OpenAI 推出 LifeSciBench 用于评估生命科学领域的自主 AI

OpenAI 推出 LifeSciBench 用于评估生命科学领域的自主 AI

OpenAI 已推出 LifeSciBench,这是一项基准,用于评估 AI 系统是否能够支持真实的生命科学研究任务。与传统评估侧重于狭窄领域或孤立技能不同,LifeSciBench 评估模型处理现实研究复杂性的能力,包括解释不完整的证据、调和冲突的结果以及在不确定性下设计实验。

基准组成与分类

LifeSciBench 包含 750 项由专家撰写的任务,覆盖七个生物学领域和七个核心研究工作流。这些工作流是通过对在职生命科学家进行调查,以确定应用研究环境中最常见的活动而确定的:

  • 证据处理:从各种来源提取、调和和审计科学证据。
  • 分析
  • 设计与优化
  • 验证与运营
  • 转化:药物开发的“从实验台到临床”过程。
  • 科学推理
  • 科学交流

为了体现研究的实践性,基准包括 1,062 个任务工件,如 PDF、图形、表格、序列文件和化学结构文件。超过一半(53%)的任务要求模型从至少一个此类工件中综合信息。

数据集构建与专家验证

LifeSciBench 由 173 位具备博士水平培训并拥有生物技术或制药行业经验的科学家开发。构建过程强调科学基础和严谨性:

  • 迭代审查:被接受的任务平均经历了六轮自动审查循环,并至少进行两轮专家审查。
  • 共识:审查基于可验证的正确答案或强有力的专家共识,要求相关领域的审稿人之间至少有 90% 的一致性。
  • 独立验证:该基准进一步由 453 位独立审稿人验证(其中 97% 拥有博士或同等学历)。这些审稿人在包括与真实工作对齐和评估模型性能的有用性等类别上报告了超过 96% 的一致性。

评分方法:细粒度评分标准

由于生命科学任务往往没有唯一的“正确”答案,LifeSciBench 使用详细的、针对任务的评分标准,而非简单的二元评分。该基准采用了共计 19,020 条标准(平均每任务 25 条),用于评估科学正确性和操作实用性。

这种方法使基准能够奖励部分正确性。模型可能得到正确的高层结论,但因忽视关键的检测限制或生物学细微差别而受到惩罚。相反,即使模型未完全解决任务,只要推理质量高,也可获得部分分数。

模型表现与能力

OpenAI 使用两个指标评估该基准:通过率(达到 70% 成功阈值的任务比例)和得分(平均评分标准奖励)。

强项

前沿模型在科学综合、交流和结构化解释方面取得最大进展。GPT-Rosalind 的整体精确通过率相较于 GPT-5.5 提升,从 25.7% 上升至 36.1%。

  • 科学交流:通过率从 56.3%(GPT-5.5)提升至 71.1%(GPT-Rosalind)。
  • 转化:通过率从 36.8%(GPT-5.5)提升至 57.7%(GPT-Rosalind)。
  • 专家有用输出:在需要可操作输出的任务中,GPT-Rosalind 得分为 44.7%,而 GPT-5.5 为 29.1%。

弱项

AI 系统仍在处理大量工件和操作受限的工作时表现困难:

  • 工件整合:当引入工件时,通过率显著下降。GPT-Rosalind 在仅文本任务上的通过率为 45.1%,而在涉及工件或 URL 的任务上降至 28.1%。
  • 设计与分析:“设计、优化与预测”(通过率 30.7%)和“分析”(通过率 30.3%)仍是 GPT-Rosalind 最困难的工作流。
  • 精确输出:模型在需要精确序列、结构或数值输出的任务上表现不佳。GPT-Rosalind 在数值任务上仅达到 14.8%,在序列或结构输出上为 24.0%。

限制与未来方向

LifeSciBench 衡量的是任务层面的能力,而非下游研究影响的直接代理。它侧重于自包含任务,未能捕捉实时研究的迭代特性,即假设会根据新出现的证据进行修正。

OpenAI 表示,下一阶段的开发将把这些基准结果与实时研究工作流中的部署研究相结合,以确定 AI 系统是否真的能够加速发现或在更长的时间范围内提升研发成果。

Sources