Anthropic 于 2026 年 9 月 4 日星期四宣布,根据该公司的官方公告,克劳德已经完成了费马大定理的第一个完整的计算机检查证明,这是数学界最著名的成果之一,他在 11 天内基本上自主工作,并用精益编程语言编写了 1300 万行代码。

这一里程碑立即引起了整个研究界的关注,在发布后数小时内就超越了《黑客新闻》。该定理的正式证明预计需要社区多年的努力;相反,由数十名克劳德特工合作组成的团队在不到两周的时间内完成了这项工作。有关当今 AI 功能现状的更多背景信息,请参阅我们的最新 AI 发展

费马大定理是什么——以及为什么它 350 年来一直无法证明

费马大定理指出,对于任何大于 2 的 n 值,没有正整数 a、b 和 c 可以满足方程 aⁿ + bⁿ = cⁿ。皮埃尔·德·费马于 1637 年左右在他的丢番图算术副本的页边空白处记下了这一主张,并添加了他现在的传奇注释,即他发现了一个真正奇妙的证明,但页边空白太窄而无法容纳。

三个多世纪以来,这个猜想比任何证明它的尝试都更持久。根据 Anthropic 的说法,1908 年宣布的 100,000 德国金马克奖金仅在第一年就吸引了 621 次错误尝试。安德鲁·威尔斯爵士最终在 1993 年提出了正确的证明——只是审稿人在验证两个月后才揭露了一个关键的差距。怀尔斯花了一年的时间与他以前的学生理查德·泰勒 (Richard Taylor) 一起修复证明,然后于 1995 年 5 月出版了最终的 129 页版本,并花费了数月的艰苦工作来验证。

Claude 如何构建 1300 万行的证明

该项目由哥伦比亚大学人类学研究员 Tianyi Peng 发起,他的团队负责构建人工智能形式化工具,他的目的是测试 Claude 能否在将 Wiles 的证明转换为机器可检查的形式方面取得进展。

在改变方法后,这一努力才取得了成功。 Anthropic 报告称,特工们最初的尝试失败了,因为他们失去了对项目状态的追踪并停止了有效的合作。 Prove2Me 取得了突破,这是一个开放式协作平台,由 Peng 和哥伦比亚大学的合作者设计,用于形式化数学。该平台维护定理陈述的有向无环图,代理用它来决定接下来要证明什么,通过将陈述与证明分开来加速精益编译,并让代理通过每个定理的自然语言描述来搜索和重用结果。

该代理团队在基于 Claude Code 的多代理工具上运行,消耗了内部研究模型的大约 60 亿个输出代币,Anthropic 将该模型描述为与 Claude Fable 5.1 大致相当。人类的输入仅限于偶尔的高级指令——Anthropic 引用了诸如“雅可比作为一种方案听起来非常优先”之类的信息,并要求尽快完成马祖尔定理。证明于 8 月 18 日 UTC 时间 02:00 完成,当时平台的根定理翻转为“已证明”。

一路走来,克劳德证明了 30,300 个定理,并在最终证明中使用了其中 29,500 个定理。 Lean 包含 1300 万行,结果是形式化数学主要社区图书馆 Mathlib 大小的五倍多。该证明遵循亨利·达蒙 (Henri Darmon)、弗雷德·戴蒙德 (Fred Diamond) 和理查德·泰勒 (Richard Taylor) 对怀尔斯 (Wiles) 论证的简化阐述,并改编了凯文·巴扎德 (Kevin Buzzard) 领导的伦敦帝国理工学院形式化项目的部分内容。

为什么精益证明可以解决这个问题

决定结果的是仲裁者。像 Lean 这样的证明助手通过算法验证证明的逻辑,而 Anthropic 指出 Claude 的证明仅使用 Lean 的三个标准公理,并使用比较器确认定理的陈述与 Mathlib 自己的定理表述相匹配。该公司还在 GitHub 上的公共存储库中发布了证明。

巴扎德审查了这一结果,他明确表示:“这一非凡的自动形式化成就,人类学研究人员称只花了 11 天,就证明了费马大定理,除了数学公理之外没有任何假设。”

Anthropic 小心翼翼地正确定位新奇事物。与最近由人工智能驱动的黎曼假设研究产生了新颖的数学不同,这里没有什么新的数学——成就是验证,以计算器检查算术的方式检查现有的证明。鉴于精益——而不是人择——是正确性的最终权威,这一说法并不取决于公司自己对其模型的评估。

这对数学和人工智能研究意味着什么

其影响是双向的。对于数学家来说,自动形式化可以发现现有知识库中的错误,并大大减轻新结果的评审负担,而这个过程可能需要数年时间。 “如果 FLT 的自动形式化现在成为可能,那么我们就向现代数学文献的自动形式化迈出了一大步,”巴扎德在题为“人择已经打败了我”的后续博客文章中写道,承认他自己于 2024 年启动的社区主导的努力已经被超越。

对于人工智能实验室来说,结果表明正式工具可能会遏制该技术最臭名昭著的弱点之一。 Anthropic 指出,编写精益似乎可以帮助克劳德证明新颖的结果,代理人使用部分形式证明来独立检查假设,就像他们编写数值模拟一样。该公司还认为,进入壁垒正在崩溃:在一个小实验中,克劳德·马克斯的三个个人计划足以让合作特工在三天内将维诺格拉多夫的三素数定理形式化。

这些警告仍然是真实的。证明需要一个专门构建的平台、数十亿个代币和一个异常清晰的成功标准——检查已经存在的答案比发现新定理更容易。但作为人工智能系统现在可以在前沿数学形式化的证明,11 天解决 358 年问题的时间尽可能生动地说明了这一点。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →