OpenAI FrontierScience 基准发布

OpenAI 已发布 FrontierScience,一个新的基准,旨在评估 AI 模型的专家级科学能力。此基准通过提供原始且困难的任务来解决现有科学基准的饱和问题,这些任务既测量结构化科学推理也测量开放式研究能力。

FrontierScience 基准结构

FrontierScience 包含超过 700 道物理、化学和生物学的文本问题,其中有一套 “金标准” 共 160 道问题用于主要评估。该基准分为两个不同的轨道,以衡量不同类型的科学智能:

FrontierScience-Olympiad

此轨道包含 100 道由国际奥林匹克奖牌得主和国家队教练设计的问题(代表 109 枚奖牌)。它通过受限的简答形式评估科学推理。这些理论问题的难度至少与国际奥林匹克竞赛中的问题相当。

FrontierScience-Research

此轨道由博士级科学家(包括博士候选人、教授和博士后研究员)设计的 60 项原始研究子任务组成。这些任务是自包含的、多步骤的问题,反映了博士科学家在活跃研究期间会遇到的难度。此轨道的表现使用 10 分评分标准进行评分,该标准评估最终答案和中间推理步骤。

模型表现和结果

在初步评估中,GPT-5.2 在两个轨道上均表现最佳,尽管结果凸显了结构化推理与开放式研究之间的显著差距:

  • FrontierScience-Olympiad: GPT-5.2 得分 77%,Gemini 3 Pro 紧随其后,得分 76%。
  • FrontierScience-Research: GPT-5.2 得分 25%。

评估还包括其他前沿模型,如 Claude Opus 4.5、Gemini 3 Pro、GPT-4o、OpenAI o4-mini 和 OpenAI o3。数据表明,更长的推理努力(思考时间)会导致准确率提升。

尽管有这些进步,OpenAI 指出前沿模型仍在推理、逻辑和计算错误、事实不准确以及对小众科学概念缺乏理解方面挣扎。

评分方法

为了确保可扩展性和准确性,OpenAI 为两个轨道采用不同的评分机制:

  • 简答验证: 奥林匹克集使用数字、表达式或模糊字符串匹配来验证正确性。
  • 基于评分标准的评分: 对于研究集,基于模型的评分器(GPT-5)根据 10 分评分标准评估响应。如果得分至少为 7/10 分,则视为“正确”。这种基于评分标准的方法允许分析中间推理步骤,而不仅仅是最终输出。

对科学研究的影响

虽然 FrontierScience 是一种标准化测量工具,但 OpenAI 报告称,像 GPT-5 这样的模型已经在加速真实世界的科学工作流程。根据论文《Early science acceleration experiments with GPT-5》(2025 年 11 月),这些系统正被用于跨学科文献检索和复杂的数学证明,常常将以前需要数周的工作缩短到数小时。

OpenAI 将 FrontierScience 定位为专家级推理的“北极星”,尽管它承认该基准的局限性。它目前尚未衡量生成真正新颖假设的能力,也不衡量与物理实验系统和多模态数据(如视频)交互的能力。

Sources