同社の公式発表によると、Anthropicは2026年9月4日木曜日、クロード氏が11日間にわたってほぼ自律的に作業し、リーンプログラミング言語で1300万行のコードを記述し、数学で最も有名な成果の1つであるフェルマーの最終定理のコンピューターチェックによる初の完全な証明を作成したと発表した。

このマイルストーンは研究コミュニティ全体で即座に注目を集め、発行から数時間以内に Hacker News でトップになりました。定理の正式な証明には、コミュニティによる数年にわたる取り組みが必要と予想されていました。代わりに、数十人の協力的なクロード エージェントからなるチームが 2 週間以内に仕事を完了しました。 AI 機能の現在の状況に関する詳細については、最新の AI 開発を参照してください。

フェルマーの最終定理とは何か — そしてそれが 350 年間証明されなかった理由

フェルマーの最終定理は、正の整数 a、b、c は、n の値が 2 より大きい場合、方程式 aⁿ + bⁿ = cⁿ を満たすことができないと述べています。ピエール・ド・フェルマーは、1637 年頃にこの主張をディオファントスの『算数』のコピーの欄外に書き留め、欄外が狭すぎて収めることができない真に驚くべき証明を発見したという、今では伝説となっているメモを付け加えました。

3 世紀以上にわたり、この推測はそれを証明しようとするあらゆる試みよりも長く続きました。 Anthropic の説明によると、1908 年に発表された 100,000 ドイツ金マルクの賞金は、初年度だけで 621 件の誤った試みを引き起こしました。アンドリュー・ワイルズ卿は 1993 年についに正しい証明を提出しましたが、検証から 2 か月で重大なギャップが査読者に暴露されました。ワイルズは、1995 年 5 月に 129 ページの決定版を出版するまで、元教え子のリチャード・テイラーと 1 年をかけて校正刷りを修正しましたが、その検証には何か月もの骨の折れる作業がかかりました。

クロードはどのようにして 1,300 万行の証明を構築したか

このプロジェクトは、コロンビア大学のグループが AI 形式化ツールを構築している人類研究者、Tianyi Peng によって開始されました。彼は、クロードがワイルズの証明を機械チェック可能な形式に変換する作業を進めることができるかどうかをテストすることに着手しました。

この取り組みはアプローチを変えて初めて成功しました。 Anthropic の報告によると、エージェントの最初の試みは、プロジェクトの状態を見失い、効果的に連携できなくなったため、失敗に終わりました。この画期的な進歩は、Peng とコロンビアの共同研究者によって設計された、数学を形式化するためのオープンな共同プラットフォームである Prove2Me によってもたらされました。このプラットフォームは、エージェントが次に何を証明するかを決定するために使用する定理ステートメントの有向非巡回グラフを維持し、ステートメントを証明から分離することでリーン コンパイルを高速化し、エージェントが各定理の自然言語記述を通じて結果を検索して再利用できるようにします。

Claude Code ベースのマルチエージェント ハーネス上で実行されているエージェント チームは、Anthropic が Claude Fable 5.1 にほぼ匹敵すると説明する内部研究モデルから約 60 億の出力トークンを消費しました。人間による入力は、時折の高レベルの指示に限定されていました。アントロピック氏は、「スキームとしてのヤコビアンは優先度が高いと思われます」などのメッセージや、マズールの定理をすぐに実行するよう求める要求を挙げています。証明は 8 月 18 日の 02:00 UTC に完了し、プラットフォームの根定理が証明済みに切り替わりました。

その過程で、クロードは 30,300 の定理を証明し、そのうちの 29,500 を最終証明で使用しました。 Lean の 1,300 万行という結果は、形式化された数学の主要なコミュニティ ライブラリである Mathlib の 5 倍以上のサイズになります。この証明は、ヘンリ・ダーモン、フレッド・ダイアモンド、リチャード・テイラーによるワイルズの議論の簡略化された解説に続き、ケビン・バザードが主導したインペリアル・カレッジ・ロンドンの公式化プロジェクトの一部を応用している。

無駄のない証明が問題を解決する理由

結果を決定的にするのは裁定者です。 Lean のような証明アシスタントは証明の論理をアルゴリズム的に検証し、Anthropic は、Claude の証明では Lean の 3 つの標準公理のみが使用され、定理のステートメントが Mathlib 自身の定理の定式化と一致することを確認する比較器を使用すると述べています。同社は証拠を GitHub のパブリックリポジトリでも公開しています。

結果をレビューしたバザード氏は明白だった。「この驚異的な自動形式化の成果は、人間研究者らによればわずか 11 日しかかからなかったというが、数学の公理以外の何の仮定もなしにフェルマーの最終定理を証明したものだ。」

Anthropic は、目新しさを正しく位置付けるように注意しています。新しい数学を生み出したリーマン予想に関する最近の AI 主導の研究とは異なり、ここには新しい数学は何もありません。成果は検証であり、電卓が算術をチェックするように既存の証明をチェックします。 Anthropic ではなく Lean が正しさに関する最終的な権威であることを考えると、この主張は自社のモデルに対する同社自身の評価に基づいたものではありません。

数学と AI 研究にとっての意味

その影響は双方向にあります。数学者にとって、自動形式化は既存の知識コーパスのエラーを検出し、新しい結果に対する審査の負担を劇的に軽減する可能性があります。このプロセスには何年もかかる場合があります。バザード氏は、「FLTの自動形式化が今可能であれば、現代の数学文献の自動形式化に向けて大きな一歩を踏み出したことになる」と、「Anthropicに打ちのめされた」というタイトルのフォローアップブログ投稿で書き、2024年に始まったコミュニティ主導の自身の取り組みが追い抜かれたことを認めた。

AI ラボにとって、この結果は、正式なツールがテクノロジーの最も悪名高い弱点の 1 つを抑制できる可能性があることを示唆しています。 Anthropic は、エージェントが数値シミュレーションを作成するのと同じように、部分形式的な証明を使用して仮説を独立してチェックすることで、リーンを書くことがクロードが新しい結果を証明するのに役立つようだと指摘しています。同社はまた、参入障壁が崩壊しつつあると主張している。小規模な実験では、協力エージェントがヴィノグラドフの三素数定理を3日間で定式化するには、3つの個人的なクロード・マックス計画があれば十分だった。

警告は依然として現実のものです。証明には、専用のプラットフォーム、数十億のトークン、そして異常に明確な成功基準が必要でした。すでに存在する答えを確認することは、新しい定理を発見するよりも簡単です。しかし、AI システムが最前線で数学を形式化できることを示すものとして、358 年問題に対する 11 日間の取り組みは、その点を可能な限り鮮明に示しています。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→