OpenAI 首次證明提交

OpenAI 使用內部推理模型嘗試了 First Proof 挑戰的全部十題,這是一項旨在測試 AI 在專業領域中產出可檢驗、端到端論證的研究級數學競賽。此里程碑展示了模型在長鏈推理方面的能力,以及解決多年來仍未解決問題的潛力。

模型在 First Proof 題目上的表現

OpenAI 認為模型的至少五個證明嘗試——具體為第 4、5、6、9、10 題——有很高的正確概率。雖然其他幾項嘗試仍在審核中,團隊已在官方評論與社群分析之後撤回了最初認為第 2 題嘗試正確的看法。

研究者 James R. Lee 指出模型的能力在訓練過程中有實質提升:

‘我們目前正在訓練一個新模型,主要聚焦於提升其思考的嚴謹程度,目標是讓模型能持續思考多小時且對結論保持高度自信。當 First Proof 題目公布時,這看起來是完美的測試平台……它已經能解出兩題(#9 與 #10)。隨著訓練進行,它的能力不斷提升,最終在我們的估計下又解出了至少三題。’

方法論與人工監督

這些證明嘗試是在有限的人類監督下產生的。過程中包含了以下具體介入:

  • 策略指導: 人類建議重新嘗試在先前嘗試中顯示出成效的策略。
  • 精煉: 應專家回饋,要求模型擴充或闡明證明的某些段落,以協助驗證。
  • 驗證支援: 內部模型與 ChatGPT 之間的來回互動,用於格式、風格與驗證。
  • 選擇: 當有多個嘗試時,由人類根據判斷挑選最佳版本。

OpenAI 承認這是一場「快速衝刺」,且缺乏正式評估的受控環境,並表達希望與 First Proof 組織者合作,建立更嚴謹的未來框架。

前沿研究在 AI 評估中的角色

OpenAI 主張新穎的前沿研究是評估下一代 AI 模型最有效的方式。公司指出標準基準常無法捕捉研究中最具挑戰性的面向,例如:

  • 維持長鏈推理。
  • 選擇適當的抽象層次。
  • 處理問題陳述中的模糊性。
  • 產出能經得起專家審查的論證。

推理能力的背景

這些成果建立在一系列 AI 在數學與科學推理方面的進展之上:

  • 2025 年 7 月: 通用推理模型在國際數學奧林匹克中取得金牌等級表現(35/42 分)。
  • 2025 年 11 月: 分享了 GPT-5 在物理、生物與數學領域加速科學的案例研究。
  • 近期發展: GPT-5.2 提出了一個理論物理中膠子振幅公式的候選表達式,隨後由內部模型正式證明並得到作者驗證。

Sources