OpenAI 首次證明提交
OpenAI 使用內部推理模型嘗試了 First Proof 挑戰的全部十題,這是一項旨在測試 AI 在專業領域中產出可檢驗、端到端論證的研究級數學競賽。此里程碑展示了模型在長鏈推理方面的能力,以及解決多年來仍未解決問題的潛力。
模型在 First Proof 題目上的表現
OpenAI 認為模型的至少五個證明嘗試——具體為第 4、5、6、9、10 題——有很高的正確概率。雖然其他幾項嘗試仍在審核中,團隊已在官方評論與社群分析之後撤回了最初認為第 2 題嘗試正確的看法。
研究者 James R. Lee 指出模型的能力在訓練過程中有實質提升:
‘我們目前正在訓練一個新模型,主要聚焦於提升其思考的嚴謹程度,目標是讓模型能持續思考多小時且對結論保持高度自信。當 First Proof 題目公布時,這看起來是完美的測試平台……它已經能解出兩題(#9 與 #10)。隨著訓練進行,它的能力不斷提升,最終在我們的估計下又解出了至少三題。’
方法論與人工監督
這些證明嘗試是在有限的人類監督下產生的。過程中包含了以下具體介入:
- 策略指導: 人類建議重新嘗試在先前嘗試中顯示出成效的策略。
- 精煉: 應專家回饋,要求模型擴充或闡明證明的某些段落,以協助驗證。
- 驗證支援: 內部模型與 ChatGPT 之間的來回互動,用於格式、風格與驗證。
- 選擇: 當有多個嘗試時,由人類根據判斷挑選最佳版本。
OpenAI 承認這是一場「快速衝刺」,且缺乏正式評估的受控環境,並表達希望與 First Proof 組織者合作,建立更嚴謹的未來框架。
前沿研究在 AI 評估中的角色
OpenAI 主張新穎的前沿研究是評估下一代 AI 模型最有效的方式。公司指出標準基準常無法捕捉研究中最具挑戰性的面向,例如:
- 維持長鏈推理。
- 選擇適當的抽象層次。
- 處理問題陳述中的模糊性。
- 產出能經得起專家審查的論證。
推理能力的背景
這些成果建立在一系列 AI 在數學與科學推理方面的進展之上:
- 2025 年 7 月: 通用推理模型在國際數學奧林匹克中取得金牌等級表現(35/42 分)。
- 2025 年 11 月: 分享了 GPT-5 在物理、生物與數學領域加速科學的案例研究。
- 近期發展: GPT-5.2 提出了一個理論物理中膠子振幅公式的候選表達式,隨後由內部模型正式證明並得到作者驗證。
Sources
- OriginalOur First Proof submissions