OpenAI GPT-5.2 發布:推進科學與數學

OpenAI 已推出 GPT-5.2 Pro 與 GPT-5.2 Thinking,這些模型專為高精度科學與數學工作進行優化。這些模型旨在透過提供更一致且可靠的多步驟邏輯、數據分析與實驗設計推理能力來加速科學研究。

高精度推理與基準表現

GPT-5.2 Pro 與 GPT-5.2 Thinking 在一般推理與抽象能力上展現顯著提升,OpenAI 認為這是發展通用智能(AGI)的基礎。這些能力使模型能在長思考鏈中保持一致性,並跨越不同領域進行泛化。

模型在專門基準測試上的表現如下:

  • GPQA Diamond: 在此研究生水準的 "Google-proof" 問答基準測試中,該測試涵蓋物理、化學與生物,GPT-5.2 Pro 取得 93.2% 的分數,而 GPT-5.2 Thinking 取得 92.4%。這些結果是在未啟用工具且推理力度設定為最大的情況下獲得的。
  • FrontierMath (Tier 1–3): GPT-5.2 Thinking 透過在此專家級數學評估中解決 40.3% 的問題,達到了新的最先進水準。

科學工作流程中的應用

強大的數學推理是技術工作可靠性的基礎,使模型能夠避免在模擬、統計、預測與建模中產生累積錯誤。這些改進直接體現在實際的科學工作流程中,包括編碼與實驗設計。

在具有 axiomatic 理論基礎的領域,例如理論計算機科學與數學中,這些模型可透過以下方式協助研究者:

  • 探索證明
  • 測試假設
  • 識別可能需要大量人力才能發現的關聯

人類監督在 AI 驅動研究中的角色

OpenAI 強調 GPT-5.2 模型並非獨立的研究者。人類專家判斷、驗證與領域理解仍然必不可少,因為模型仍可能犯錯或依賴未說明的假設。

在 AI 輔助科學中的可靠進展取決於優先考驗證、透明度與合作的工作流程。在這種新興的研究實踐模式中,GPT-5.2 作為支援推理與早期探索的工具,而人類研究者則保留對正確性、解釋與情境的責任。

Sources