Anthropic Claude 自動將費馬大定理形式化

TL;DR

Anthropic 的 Claude 模型在短短 11 天內生成了完整的、經 Lean 驗證的費馬大定理證明,編寫了 1300 萬行程式碼並證明了 29,500 個中間定理,這顯示 AI 現在可以自主地將高度複雜的數學結果形式化。

成就概述

Claude 在很大程度上無需人類干預,將 Andrew Wiles 的證明翻譯成機器可檢查的形式。生成的 Lean 證明已發布在 GitHub 上,並由 Kevin Buzzard 進行審查,他根據 Mathlib 對該定理的陳述進行了正確性確認。

"This extraordinary autoformalization achievement… proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics." – Kevin Buzzard

技術流程

自動證明生成

  • Claude 運行了 11 天,產生了 1300 萬行 Lean 程式碼
  • 系統總共證明了 30,300 個定理,其中 29,500 個出現在最終的 FLT 證明中。
  • 數十個 Claude agent 進行了協作,每個 agent 分別處理定義、中間引理或更高層級的定理。

Prove2Me 協作平台

Prove2Me 是一個開放式協作形式化平台,對成功至關重要:

  1. 定理陳述的定向無環圖 (DAG) – 引導 agent 走向下一個邏輯目標並防止專案狀態丟失。
  2. 陳述與證明的分離存儲 – 加速了 Lean 編譯並減少了資源使用。
  3. 自然語言描述 – 實現了對現有引理的高效搜索與重用。

這些功能減輕了記憶退化問題,並允許許多 agent 進行並行工作。

資源消耗

  • 由一個與 Claude Fable 5.1 相當的研究級模型生成了約 60 億個輸出 token
  • 該證明僅依賴於 Lean 的三個標準公理;一個對照組確認了其與 Mathlib 的 FLT 陳述完全一致。

與先前嘗試的比較

  • 社群對形式化 FLT 的藍圖(86 頁)預計需要數年的工作;Claude 在不到兩週內完成了任務。
  • 最終的 Lean 程式碼庫比作為基礎的正式化數學主要庫 Mathlib 大於 5 倍
  • 先前的 FLT 自動形式化嘗試均告失敗,僅對最終證明中的非樣板程式碼行數貢獻了約 7%。

對數學的影響

減少驗證負擔

  • 自動形式化可以大幅縮短驗證複雜證明所需的時間,這在歷史上需要人類投入數月或數年的努力。
  • Kevin Buzzard 指出,這一步驟使社群更接近於自動形式化現代數學文獻,潛在於根除隱藏的錯誤並減輕審稿人的工作量。

對 AI 生成數學的信任

  • 正式化證明提供了一種明確的正確性保證,與人類可讀的論述展現相輔成效。
  • 隨著 AI 生成的猜想增加,擁有一個能同時產生 Lean 證明的自動化流程,可以使驗證過程具備可擴展性。

擴展到其他定理

  • Anthropic 展示了使用相同的協作設置,在三天內完成了 Vinogradov’s Three-Primes Theorem 的形式化。
  • 在適當的架構支持下,消費級 AI 訂閱服務即可形式化主要的研究結果。

未來方向與支持

  • Anthropic 與其他實驗室正在為外部研究人員擴大免費或折扣存取權,並提供專用於大規模形式化專案的專屬資助。
  • 目前的工作旨在改進 Lean, Mathlib, 和 Prove2Me 等協作工具,以降低未來自動形式化的門關檻。

致謝

此項工作建立在數十年的數學發展基礎之上——從 Wiles 的原始證明到 Imperial College 的 FLT 專案,以及更廣泛的 Lean 社群。Kevin Buzzard 提供了審查與反饋,並該證明遵循了 Darmon, Diamond, and Taylor 的論述展現。

資源

  • GitHub repository – 完整的 Lean 證明與隨附的導覽:https://github.com/anthropics/fermats-last-theorem
  • Prove2Me paper – 協作平台的詳細描述:Chen et al., 2026, arXiv 2608.28433.
  • Related Anthropic posts – 自動形式化 Riemann hypothesis, 自動對齊研究, 以及其他 AI 驅動的科學進步。

Sources