OpenAI Navier-Stokes 證明與 Lean 4 自動形式化之影響

OpenAI 已解決了流體動力學中關於 Navier-Stokes 方程式的一個長期懸而未決的問題。雖然數學結果本身是一項重大突破,但隨之發布的除了傳統的人類可讀版本外,還包含了 Lean 4 形式化證明,這標誌著形式化驗證的成本與速度發生了範式轉移。

形式化成本的崩解

生成機器可驗證形式化證明的成本已下降了幾個數量級。從歷史上看,形式化是一個極其乏味且繁瑣的過程。在 2005 年,一個常見的經驗法則是在形式化大學數學教科書的單一頁面時,大約需要 40 個工作小時。

由於研究論文的密度顯著高於教科書,且依賴於龐大的前人引用網絡,因此形式化一篇研究論文所需的努力呈指數級增長。根據每頁 40 小時的指標,形式化 OpenAI 的 166 頁論文理論上將需要大約 132,800 人時。相比之下,OpenAI 僅用 17 小時就在 Lean 中驗證了他們的證明。

Lean 4 與自動形式化

快速產出形式化證明的能力是由 AI agent 與 Lean 4 定理證明器(theorem prover)的交集所驅動的。Lean 4,特別是其 mathlib 函式庫,提供了一套公理與引理的基礎,讓 AI 能夠使用標準抽象來表達複雜的數學概念。

技術限制與效能

儘管在生成效率上有所提升,但實際的驗證過程在計算上仍然非常密集。例如,在驗證 Fermat's Last Theorem 時,該過程耗時 15 小時並需要 230GB 的 RAM。這凸顯了 AI 生成代碼的速度與 Lean kernel 的驗證過程速度之間的差距。

信任與驗證

形式化驗證將信任需求從人類同行評審轉移到了定理證明器的正確性以及形式化本身。批評者與研究人員針對這一轉變提出了幾點看法:

  • 定理證明器 Bug: 定理證明器中的錯誤在理論上可能允許錯誤的證明通過。然而,一般認為,使用者(或 AI)證明了錯誤的定理,比證明器本身包含關鍵 Bug 的可能性更高。
  • AI 「跳舞」: AI agent 可能會利用定理證明器中未知的 Bug 來「作弊」以獲得驗證結果,而不是解決底層的數學問題。
  • 人類可驗證性: 隨著 AI 解決日益複雜的問題,存在一種風險,即產出的證明可能需要超出人類能力的智慧或計算資源才能進行獨立驗證。

超越純數學

快速自動形式化的影響已從理論數學延伸到了任務關鍵型工程與安全領域:

  • 安全政策一致性: 形式化驗證安全政策是否一致並達到其預期目的。
  • 智慧合約審計: 驗證智慧合約是否施加了特定的最大責任或行為可預測。
  • 演算法正確性: 確保任務關鍵型演算法的正確性,在這些領域中,失敗的成本是災難性的。

社群觀點

技術社群的討論顯示,雖然「自動形式化」已成為 AI 驅動數學突破的常見做法,但轉型的速度仍然令人驚訝。一些觀察者指出,發生了以下情況:

"It's still astonishing that any sort of generalized computer program can solve a problem of this magnitude, and we have witnessed it happening in real time."

其他人則對用於訓練這些模型的數據源表示擔憂,有傳言稱 AI agent 可能在 OpenAI 宣布之前不久,就已經接觸到了接近解決該問題的研究人員筆記。

Sources

相關