Claude がフェルマーの定理を11日で決着: Lean 1,340万行、「明らかに」はゼロ
9 月 4 日、Anthropic は、フェルマーの最終定理の史上初の完全なマシン テストを披露しました。 Claude は 11 日間で、ほとんど人の助けを借りずに、アンドリュー ワイルズの証明を言語 Lean に翻訳しました。コードは 1,340 万行、中間定理は約 3 万個で、「言われたことから明らか」なものはゼロでした。このプロジェクトは数学者たちが何年も計画していたもので、インペリアル・カレッジ・ロンドンのケビン・バザードによる第1段階の図面だけが86ページあったが、1週間半で完成した。
ここにないものをすぐに明らかにしましょう。新しい証拠はありません。モデルは定理への独自の道を思いつきませんでした。彼女は何か違うことをしました、そして、率直に言って、それほど複雑ではありませんでした。彼女は人間の証明を採用し、すべてのページに「これは簡単に続きます」のような免責事項があり、コンパイラーが各ステップをチェックするようにそれを書き直しました。 1995 年以降の数学者は、この定理に 99.9% の自信を持っていました。これで、100 パーセント実行できます。Lean は 3 つの標準公理からの導出全体を実行しており、これ以上疑う余地はありません。
コンピューターは一体何をチェックしたのでしょうか?
ここでは形容詞よりも数字の方が適切です。
- Lean の 1,340 万行は、システムの主要な正式な数学ライブラリである Mathlib 全体の 5 倍以上の大きさです。
- 約 30,000 の中間定理が証明されています。最終的な生産量は約 29,500 でした。
- 96 コア マシンでリポジトリをコンパイルするには、Mathlib をコンパイルするよりも約 20 倍の時間がかかります。 Buzzard には、テスト期間中、500 GB の RAM を搭載したサーバーが与えられました。
- 信頼できるのは 3 つの標準公理 Lean だけです。 「簡素化のための前提」はありません。
Kevin Buzzard 氏は、2024 年からコミュニティのフェルマー形式化プロジェクトを主導してきた同じ数学者で、リポジトリをダウンロードして組み立て、コンパレーターを実行しました。定理の出力定式化は Mathlib からの参照定式化と一致し、すべてのチェックは緑色です。彼のレビューは「自動形式化の並外れた成果」です。

余白の一行、3世紀半の仕事
1637 年頃、ピエール・ド・フェルマーは、ディオファントスの『算術』の欄外に次の記述があると考えました。n が 2 より大きい場合、方程式 aⁿ + bⁿ = cⁿ には自然数の解がありません。以下は伝説となったフレーズです。「本当に素晴らしい証拠を見つけましたが、その証拠には幅が狭すぎます。」オイラーからクンマーに至るまでの数世代の数学者は、その結果に向かって少しずつ取り組んできました。 1908 年には、証明に対して 10 万金マルクの賞金が授与され、初年度は 621 件の不正解を受け取りました。
1993 年 6 月、アンドリュー ワイルズはケンブリッジでの一連の講義で自身の証明を発表しました。 2 か月後、査読者が質問したところ、デザインの 1 つに穴があることが明らかになりました。ワイルズは 1 年間、すべてを諦めかけていた状況を最初は一人で、次に元教え子のリチャード・テイラーと一緒に修復し、1995 年に 129 ページのテキストを出版しました。最後の「工学的」な疑問が残りました。コンピュータにこれらすべてを完全に確認させることは可能でしょうか?
新しい証拠ではなく、新たな機会
これは、ダーモン、ダイアモンド、テイラーによる 1995 年のラングランズ・トンネル定理とリベット準降下によるワイルズ・テイラー議論の分析に基づいています。ワイルズを形式化するというアイデアは 2000 年代にオランダのコンピューター科学者ヤン ベルグストラによって表明されましたが、最近までこれは科学全体の方向性のための取り組みであると考えられていました。個々のケース - 第 4 度、通常の単純なケース - は以前に Lean に移動されました。新しいリポジトリにより、Weidik の 100 の形式化タスクのリスト全体が閉じられました。この領域が比較されたベンチマークは 20 年前のものです。
ちなみに、バザードは正直に次のように書いている:数学的には、この研究は何も新しいことを明らかにしていない - 彼はすでにワイルズを信じていた。価値は別のところにあります。数学の新しい論文をレビューするには数か月、場合によっては数年かかります。機械がオンザフライで証明を形式化するように要求できれば、ピアレビューは縮小し、専門家レベルの隠れた仮定が表面化し始めるでしょう。結論の誠実さにすべてがかかっている科学にとって、これは重大な変化です。
内側から見た11日間の様子
この研究は、以前にコロンビア大学で AI 形式化ツールのグループをまとめた人類研究者の Tianyi Peng によって主導されました。彼によると、当初は最後まで到達するつもりはなく、Claude がバザードのプロジェクトをどれだけ前進させるかを知りたかっただけでした。決勝戦に進出した。
多くのエージェントが並行して作業しました。一部のエージェントは数学的定義を完了し、他のエージェントは中間の補題を調べ、他のエージェントは定理ツリーを上に移動し、他のエージェントは部分を組み立てて 1 つの結論に戻しました。最初の数日はうまくいきませんでした。エージェントはプロジェクトの全体像を失い、初期の試行の約 7% が最終コードに残りました。チームが Prove2Me プラットフォームに移行したときに好転が起こりました。その中の証明は定理ノードのグラフであり、何がすでに証明されているのか、何が前提条件を待っているのか、次に何をとるべきかがわかります。ステートメントは証明から分離され、コンパイルは高速化され、各定理には検索可能なテキスト説明が付いています。作業の規模は約 60 億の出力トークンであり、人間によるプロンプトは「この方向が優先事項です」という高レベルのものに抑えられました。
どこで見るか
リポジトリは GitHub に掲載されています。96 個のコアと強力な神経を備えたマシンをお持ちの場合は、ご希望に応じて自分でチェックを実行できます。一次情報源: Anthropic からの分析 そして バザードさんの投稿 Xena プロジェクトのブログで。
1,300 万行のストーリーの後、最新のモデルがより小さなタスク (アルゴリズム、コード、計算) にどのように対処するかを知りたい場合は、次のセクションを参照してください。 "コード" そして "チャット" NeuralSpace: そこでモデルを実験し、API 経由でプロジェクトに接続できます。