1300万行代码、3万个中间定理、11天时间——这是Claude交出的答卷,目标是数学界最著名的难题之一:费马大定理。Anthropic宣布,Claude完成了费马大定理首个端到端、可由Lean程序完整检查的形式化证明。
这个数字有多夸张?整个工程的代码量,超过Lean核心数学库Mathlib的5倍。而最终证明实际使用的中间定理约29500个,完整证明仅依赖Lean的三个标准公理。定理陈述与Mathlib中费马大定理完全一致,裁判是Lean程序本身,而不是模型。
多Agent协作,从混乱到有序
项目由姚班校友Tianyi Peng主导,使用自研的Prove2Me平台实现多Agent并行协作。但这条路一开始并不顺利——早期尝试中,Agent规模一扩大,协作就开始混乱。文章里那句"人一多,活一多,项目开始乱了",说的正是这个阶段。
Prove2Me的解法是把整个证明拆成一个由定理节点组成的DAG(有向无环图)。哪个定理已经证明了,哪个还缺前置条件,下一步该攻哪个节点,Agent都能从这张图里判断。这种结构管理了前置依赖、加速了编译,还保留了自然语言描述,让多Agent像一支大型数学团队一样协同工作。
效果如何?失败代码仅占成品非模板代码约7%。整个项目消耗约60亿输出Token,通用研究模型能力大致相当于Claude Fable 5.1。
人类只给方向,AI自己干活
最反直觉的部分在这里:人类数学指导极为有限。Tianyi Peng只提供高层方向提示,比如优先级排序。大量定义补充、中间引理证明、任务拆分与拼装,全部由Claude自主完成。
这意味着什么?把人类数学家能读懂的证明,彻底翻译成计算机能一行一行检查、没有任何"这里显然"的形式化证明——这件事过去极度依赖人工,现在AI可以大规模接手了。
帝国理工学院Kevin Buzzard的评价是:一次"非凡的自动形式化成果"。这个评价的分量不轻——费马大定理证明的形式化,原本是Buzzard团队多年的社区项目,技术蓝图长达86页。
数学形式化,从人工苦力到AI工程
这次突破的意义,可能不止于一个定理。过去,数学文献的形式化工作靠人工推进,速度慢、成本高。Claude用11天完成了一个团队多年的工程,这为大规模提速提供了可能性。
当然,也有值得冷静看待的部分。60亿Token的消耗量说明成本并不低,Prove2Me平台的DAG管理机制也还在早期。但方向已经清晰:AI不仅能证明定理,还能组织一支"Agent数学团队"去完成复杂的形式化工程。
文末还附带提及OpenAI GPT-6 Astra的逐步开放,各家在Agent能力上的竞争正在加剧。数学形式化只是其中一个战场,但1300万行代码这个数字,已经足够说明问题。
热门跟贴