Claude 在 Lean 中將費馬大定理形式化
Anthropic 宣布了由 Claude 產生的第一個完整的費馬大定理 (FLT) 電腦檢查證明。該 AI 系統在 11 天內大部分自主運作,編寫了 1300 萬行 Lean 代碼,並證明了 29,500 個中間定理,實現了數學界原本預期需要數年才能完成的形式化成果。
達成成就:FLT 的自動形式化
Claude 對費馬大定理的形式化是自動形式化(autoformalization)的一個重要里程碑——即將人類可讀的數學推理轉換為電腦可以透過演算法驗證的形式的過程。
該專案的關鍵技術指標包括:
- 時間線: 11 天的自主工作。
- 規模: 1300 萬行 Lean 代碼,這比 Mathlib(Lean 的主要社群庫)的規模大五倍以上。
- 複雜度: 總共證明了 30,300 個定理,其中 29,500 個用於最終證明。
- 資源消耗: 來自一個與 Claude Fable 5.1 相當的內部研究模型的約 60 億個輸出 token。
該證明遵循 Andrew Wiles 1995 年證明的簡化版本,特別是 Darmon, Diamond, and Taylor 的闡述。它僅依賴於 Lean 的三個標準公理,並透過比較器驗證其與 Mathlib 對 FLT 的陳述一致。
使用 Prove2Me 克服驗證挑戰
形式化複雜的證明是困難的,因為像 Lean 這樣的證明助手需要每個邏輯步驟都必須明確,而人類的證明往往會跳過「顯著」的步驟。為了管理這種複雜性,Anthropic 利用了由 Tianyi Peng 與哥倫比亞大學的合作者設計的開放協作平台 Prove2Me。
Prove2Me 透過以下三個主要機制實現了專案的成功:
- 有向無環圖 (DAG) 管理: 該平台維護了定理陳述的 DAG,允許多個代理人(agents)並行工作,並透過提供清晰的「下一步證明什麼」的路線圖來減輕記憶衰退問題。
- 優化編譯: 透過將定理陳述與其證明分離到不同的文件中,系統減少了 Lean 的編譯時間和資源消耗。
- 自然語言索引: 每個定理陳述都附帶有自然語言描述,這有助於代理人團隊進行搜尋和重複使用。
對數學研究的影響
這一結果證明了 AI 現在可以形式化現有數學文獻的大部分內容,這對該領域的嚴謹性與驗證具有直接影響。
減少同行評審的負擔
傳統上,驗證一項新穎的數學結果可能需要數月或數年。自動形式化可以減輕人類審稿人的負擔,並提供一種嚴謹的方式來檢查 LLM 生成的數學內容,而這目前是一個成本高昂的人力主導過程。
增強 AI 自身的推理能力
Anthropic 指出,編寫 Lean 代碼有助於 Claude 證明新穎的結果。透過在發現結果的同時進行形式化證明,AI 可以獨立檢查自己的假設,類似於研究人員使用數值模擬來驗證研究方向。
社群觀點與批評
雖然 Imperial College London 的 Kevin Buzzard 將此成就稱為「非凡」,但該專案在技術社群中引發了關於證明性質的廣泛討論。
對「義大利麵條代碼」的擔憂
一些批評者認為,龐大的代碼量(1300 萬行)顯示該證明可能效率低下,或者缺乏人類數學家所追求的可重複使用的抽象概念。一位評論者指出:
This is quite useless actually. The whole point of formalizing FLT was to clean up modern number theory into reusable abstractions... If its 13 million LoC, it might involve so much spaghetti that its unusable other than the result.
對驗證器的信任度
人們提出了疑問,是否 AI 可能利用了 Lean kernel 本身的潛在錯誤(bugs)。因為證明非常龐大且由 AI 生成,一些用戶質疑了「誰來驗證驗證器」的問題,並建議對於如此龐大的輸出,像 Metamath 這樣較小的 kernel 可能更值得信賴。
暴力破解式自動形式化的社會價值
對於「暴力破解」式的自動形式化是否能提供與人類主導的形式化同樣的價值,目前存在爭議。有人認為,透過大規模的 token 消耗和代理人規模化,AI 實驗室可能會削弱人們進行艱苦的創造人類可理解的形式化函式庫的工作動機。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch