OpenAI 已推出 FrontierScience,這是一個新的專家級基準測試,旨在衡量 AI 進行複雜科學推理和真實世界研究任務的能力,涵蓋物理、化學和生物學。

OpenAI 已發布 FrontierScience,這是一個新的基準測試,旨在評估 AI 模型的專家級科學能力。此基準測試通過提供原創且困難的任務來解決現有科學基準測試的飽和問題,這些任務同時測量結構化科學推理和開放式研究能力。

FrontierScience 基準測試結構

FrontierScience 包含超過 700 個跨物理、化學和生物學的文字問題,並有一個「黃金集合」由 160 個問題用於主要評估。該基準測試分為兩個不同的軌道,以測量不同類型的科學智慧:

FrontierScience-Olympiad

此軌道包含 100 個問題,由國際奧林匹克獎牌得主和國家隊教練設計(代表 109 面獎牌總數)。它透過受限的簡答格式來評估科學推理。這些理論問題的設計難度至少與國際奧林匹克競賽中的問題相當。

FrontierScience-Research

此軌道由博士級科學家設計的 60 個原始研究子任務組成,包括博士候選人、教授和博士後研究員。這些任務是自包含的多步驟問題,能夠反映博士科學家在積極研究期間會遇到的難度。此軌道的表現使用 10 分評分規則進行評分,該規則同時評估最終答案和中間推理步驟。

模型表現與結果

在初步評估中,GPT-5.2 在兩個軌道上均表現最佳,儘管結果凸顯結構化推理與開放式研究之間存在顯著差距:

  • FrontierScience-Olympiad: GPT-5.2 得分 77%,Gemini 3 Pro 緊隨其後,得分 76%。
  • FrontierScience-Research: GPT-5.2 得分 25%。

評估還包括其他前沿模型,如 Claude Opus 4.5、Gemini 3 Pro、GPT-4o、OpenAI o4-mini 和 OpenAI o3。數據表明,更長的推理努力(思考時間)會帶來準確度的提升。

儘管有這些進步,OpenAI 指出前沿模型仍在推理、邏輯和計算錯誤、事實不準確以及對小眾科學概念缺乏理解方面掙扎。

評分方法學

為確保可擴展性和準確性,OpenAI 對兩個軌道採用不同的評分機制:

  • Short Answer Verification: 奧林匹克題組使用數字、表達式或模糊字串匹配來驗證正確性。
  • Rubric-Based Grading: 對於研究題組,基於模型的評分器(GPT-5)會根據 10 分評分規則評估回應。如果解答獲得至少 7/10 分,則視為「正確」。此基於評分規則的方法允許分析中間推理步驟,而不僅僅是最終輸出。

對科學研究的影響

儘管 FrontierScience 是一個標準化的測量工具,OpenAI 報告指出,像 GPT-5 這樣的模型已經在加速真實世界的科學工作流程。根據論文 早期科學加速實驗與 GPT-5 (November 2025),這些系統正被用於跨學科文獻搜索和複雜的數學證明,常常將以前需要數週的工作縮短到數小時。

OpenAI 將 FrontierScience 定位為專家級推理的「北極星」,儘管它承認該基準測試有局限性。它目前尚未衡量生成真正新穎假設的能力,也不衡量與實驗系統和多模態數據(例如視頻)互動的能力。

Sources