Anthropic宣布,其AI模型Claude完成了费马大定理的首个端到端、可由计算机完整检查的形式化证明。这项成果以约1300万行Lean代码、超过3万个中间定理的形式呈现,最终证明使用了其中约29500个定理。这意味着,人类数学家能够读懂的证明,被彻底翻译成了计算机能够逐行检查、没有任何“这里显然”的形式化证明,将350多年的数学史浓缩进了庞大的代码库中。

费马大定理是数学史上最著名的难题之一,它指出对于任意整数n>2,都不存在正整数a、b、c使得aⁿ+bⁿ=cⁿ。自17世纪费马提出这一命题以来,欧拉、勒让德、库默尔等一代代数学家不断推进,却始终未能给出完整证明。直到1993年,英国数学家Andrew Wiles首次公开宣布证明,随后又花费约一年时间与Richard Taylor合作修补,最终在1994年完成证明,困扰数学界350多年的命题才被攻克。

形式化证明是将数学证明转化为计算机可验证的格式,通常使用Lean等证明助手。普通数学论文写给数学家看,人脑可以跳过许多步骤直接说“这里显然成立”,而形式化证明则要求每一步推导都从公理和定理合法地走一遍。Lean负责检查这些推导是否合法。早在2024年,帝国理工学院的Kevin Buzzard等人就启动了多年社区项目,准备用Lean完成费马大定理的形式化,仅项目第一阶段的技术蓝图就写了86页

此次项目的核心人物是Tianyi Peng,他早年是信息学竞赛尖子,曾获全国青少年信息学奥赛选拔赛第八名,2017年清华姚班本科毕业,2023年获MIT博士学位。如今他是哥伦比亚大学助理教授、Anthropic研究员,长期聚焦强化学习、AI Agent与形式化工具。在他的主导下,多Agent协作系统被用于分工:有的负责补数学定义,有的专攻中间引理,有的沿着已有成果继续推进更高层定理,还有Agent负责将不同部分重新拼回整个证明体系。

Anthropic透露,完整证明只依赖Lean的三个标准公理,他们还通过比较程序确认,Claude最终证明的定理陈述与Mathlib中的费马大定理完全一致。项目初期,多Agent协作很快遇到了几乎所有大型Agent系统都会面临的问题——随着工程规模扩大,Agent逐渐跟不上整个项目的状态,协作效率下降。为此,Tianyi Peng及其哥伦比亚大学合作者搭建了Prove2Me协作系统,专门用于数学形式化。该系统通过一张“图”让Agent判断哪些定理已证明、哪些还缺前置条件、下一步该攻哪个节点,同时将定理陈述和证明分开管理、加速Lean编译,并为每个定理保留自然语言描述,方便不同Agent搜索和复用已有成果。最终,Anthropic采用了Prove2Me+基于Claude Code的multi-agent harness方案。整个项目消耗约60亿个输出Token,内部使用的通用研究模型能力大致相当于Claude Fable 5.1

Tianyi Peng在项目中更多只是偶尔给出高层提示,比如某个方向优先级更高、某个定理需尽快推进。负责审阅结果的Kevin Buzzard将其评价为一次“非凡的自动形式化成果”。如果如此规模、如此依赖复杂度的现代数学成果都能被AI自动搬进形式化系统,那么过去极度依赖人工、推进缓慢的数学文献形式化,可能第一次真正具备了大规模提速的条件。

与此同时,OpenAI也在推进类似方向。最新信息显示,GPT-6 Astra正在逐步向ChatGPT付费用户开放,其中GPT-6 Pro面向Pro、Business和Enterprise计划推出,Pro用户还可在Chat、Work和Codex中使用Astra。Astra重点强化了推理、数学和Agent能力,预计将带动更多数学、科研和Agent应用的出现。