OpenAI 的納維-斯托克斯千禧年獎問題聲稱與 LLM 生成數學的倫理問題

OpenAI 聲稱其內部 LLM 解決了納維-斯托克斯問題

OpenAI 於 2026 年 9 月 1 日發布部落格文章,聲稱其尚未公開的模型解決了納維-斯托克斯存在性與光滑性問題,這是七個千禧年獎問題之一。該模型在這個問題上產生了 270 萬則訊息約 1300 億個輸出 token,所有嘗試問題的總計為 490 萬則訊息約 3000 億個 token。最終以 Lean 形式化的證明於 2026 年 9 月 6 日使用第二代模型(GPT‑6 Astra)完成。若以公開 API 價格計算,token 使用量的費用約為 1500 萬美元

紐約大學與 Anthropic 研究人員的競爭聲稱

紐約大學的 Tristan Buckmaster 與 Anthropic 的 Levent Alpöge 於 2026 年 9 月 8 日發布一份 PDF,描述他們長達一年的努力,其研究高度依賴 Anthropic 的 Codex(GPT‑5.6 Sol)。他們報告於 2026 年 8 月 15 日取得突破,並指控 OpenAI 可能未經同意就存取了他們的會話資料。Buckmaster 聲明中的關鍵摘錄:

「我問過模型是否曾訓練過或存取過我們在 Codex 中的會話……我被告知模型並未查詢使用者資料。」 「我並未指責任何人。」 Buckmaster 的團隊願意發表其成果,但 OpenAI 拒絕將 Alpöge 列為共同作者,理由是與 Anthropic 存在競爭關係。

OpenAI 的回應與時間軸

OpenAI 的部落格解釋,9 月 1 日他們聽聞有關兩個千禧年問題已被解決的傳言。受此傳言激勵,他們啟動自動化「代理」計畫,於 88 小時內 產出解決方案,並額外投入 17 小時 進行 Lean 驗證。他們的聲明強調:

「在公開發布前,我們並未看到他們的工作。雖然可能性低,但我們無法排除他們使用我們產品的去識別化資料,有助於提升我們模型的可能性。」 OpenAI 也指出,他們的證明與紐約大學/Anthropic 的結果不同,特別是在歐拉案例(強制 vs. 非強制)方面。

Hacker News 上的社群反應

資料隱私疑慮主導討論

  • @_bobm@bob1029 質疑 OpenAI 如何從數十億使用者會話中篩選資料,以及這些資料是否可能被納入訓練流程。
  • @jwr 對「改善模型以造福所有人」的開關效果表示懷疑,並質疑退出是否真能防止資料使用。
  • @vb-8448 直言不諱地指出,只要資料送入 LLM,最終都會被用來提升模型,無論服務條款如何。

AI 驅動數學的費用與可及性

  • @TrackerFF 指出,以 1500 萬美元的計算預算解決千禧年問題,目前對大多數研究者而言仍遙不可及,可能造成兩級研究生態系統。
  • @keremk 認為,若競爭對手可能率先獲得獎金,花費如此金額是理性的,將此事件視為一場由傳言驅動的競爭性「衝刺」。

技術可行性與模型能力

  • @civvv 指出,LLM 在訓練資料中存在大量先前工作時表現出色,但懷疑它們在缺乏人類指導的情況下能否產生真正的新數學。
  • @pietz 建議,OpenAI 的模型很可能未納入紐約大學團隊的近期草稿,因為該工作是在 GPT‑5.6 上完成,而該模型在 9 月初前尚未被整合進內部模型。

倫理與戰略影響

  • @sdcfgy 建議避免在機密研究中使用 LLM 服務,將情況類比為將實驗筆記本交給不可信的第三方。
  • @Simran‑B 質疑商業邏輯:花費 1500 萬美元贏得 100 萬美元獎金,看似更像展示能力而非獲利。
  • @stn_za 將此與傳統數學相比,研究者依賴彼此公開發表的工作,但強調當 AI 能立即回應傳言時,其速度與規模差異顯著。

這起事件揭示了 AI 驅動科學發現的哪些面向

  1. 傳言驅動的計算資源配置 – OpenAI 團隊根據傳言行動,在數天內為單一問題配置龐大資源。這類似於安全研究中的趨勢,即披露漏洞會觸發快速且大規模的攻擊嘗試。
  2. 不透明的資料使用政策 – 即使公司聲稱「不查詢」使用者資料,去識別化會話資料可能影響模型更新的可能性仍處於灰色地帶,引發法律與倫理疑慮。
  3. 進入門檻的經濟障礙 – 嘗試解決千禧年問題所需的 1000 萬至 1500 萬美元計算成本,對大多數學術團隊而言難以負擔,可能使突破集中在資金充足的實驗室。
  4. 人機協作與競爭 – 紐約大學/Anthropic 團隊使用 OpenAI 自己的 Codex 長達數月,卻在 OpenAI 發起平行計畫時感到被邊緣化。此事件凸顯了當多個團隊依賴相同 AI 服務時,需建立明確的信用歸屬、資料共享與共同作者規範。
  5. 驗證流程 – OpenAI 使用 Lean 進行形式化驗證,展現出日益成熟的作業流程:LLM 產生假設,代理探索證明空間,定理證明器驗證結果。此流程能否擴展至缺乏大量先前文獻的問題,仍有待觀察。

對社群的開放問題

  • AI 提供商應如何處理可能包含未發表突破的使用者資料?
  • 應建立何種治理結構,以確保多個團隊使用相同商業 LLM 時能公平歸屬?
  • AI 驅動的證明搜尋成本是否會下降到足以實現普及化,還是將鞏固高影響力數學的壟斷?
  • 形式化驗證工具能否跟上 AI 生成的證明草稿數量,確保正確性而不需過度的人力投入?

本文綜合原始公告、紐約大學/Anthropic 的聲明,以及 Hacker News 上最受讚賞的評論,提供對 OpenAI 納維-斯托克斯聲稱在技術、倫理與經濟層面的完整概述。

Sources

相關