OpenAI 推出 GeneBench-Pro 用于计算生物学推理

OpenAI 推出 GeneBench-Pro 用于计算生物学推理

OpenAI 已推出 GeneBench-Pro,这是一个旨在测试 AI 模型是否能够处理实际计算生物学所需的判断密集型、迭代分析的基准。与测试事实回忆或预定义工作流的传统基准不同,GeneBench-Pro 衡量“研究味道”——即处理歧义、修订假设并选择正确的分析路径以得到可决策结果的能力。

衡量“研究味道”和科学判断

GeneBench-Pro 关注限制 AI 在科学研究中表现的系统级判断。该基准将“研究味道”定义为塑造分析的判断链,包括确定数据能够支持哪些问题以及根据早期诊断知道何时修订初始计划。

为了测试这些能力,每个问题为模型提供:

  • 一个真实且混乱的数据集。
  • 简短的实验背景。
  • 与下游决策相关的目标 estimand。

模型必须探索数据,选择合适的分析方法,并参与实验的迭代过程以给出最终答案。

数据集构建和领域覆盖

GeneBench-Pro 包含 129 个问题,覆盖基因组学、定量生物学和转化医学中的 10 个领域和 21 个子领域。为了避免常见的基准失败——例如任意的作者偏好或数值不敏感——OpenAI 采用了合成数据生成。

通过模拟数据生成过程并了解完整的因果结构,OpenAI 确保:

  • 主观分析选择的合理差异仍然会产生被接受的数值结果。
  • 看似合理但错误的分析会失败。
  • 通过详细的追踪分析,信息泄漏和非预期的解决路径被最小化。

此外,129 个问题中有 82 个由外部领域专家(包括教授、行业科学家和博士后研究人员)审核,以验证真实性、目标答案的可识别性以及方法的适当性。

评估框架和评分

代理在一个配备了标准生物信息学栈的隔离工作空间中进行评估,包括 Python、科学计算库以及基本的基因组学包,如 PLINK 2.0。

由于数据是合成生成的,正确性会根据已知目标的确定性进行评分。这消除了通常与基于评分规则的评估相关的变异性和冗长效应。

OpenAI 将在 Hugging Face 上开源 10 个代表性问题,并将向 Artificial Analysis 提供一个 50 问题的子集,以进行独立的第三方基准测试。

性能结果和模型比较

GPT-5.6 Sol 是该基准上表现最强的模型,在启用 Pro 模式下通过率达到 31.5%(在最高推理级别为 28.7%)。这相比原始 GeneBench 有显著提升,其中最佳前沿模型 GPT-5 的得分低于 5%。

结果的主要发现包括:

  • Scaling Test-Time Compute: 在最高推理级别,GPT-5.6 Sol 解决的问题数量几乎是 GPT-5.2 的六倍,而使用的标记数仅约为其三分之二。
  • Model Family Gaps: GPT 模型在性能上优于领先的开源模型(如 GLM 5.2)。OpenAI 指出,在高级科学推理中的性能差距显著大于编码基准中看到的差距,这表明开源模型可能更专注于编码而非通用推理。
  • Comparison to Human Labor: 评估者估计,一个典型的 GeneBench-Pro 问题需要人类专家花费 20–40 小时完成。虽然 AI 代理目前仍然不可靠,无法取代专家,但推理成本(几美元)比估算的人工劳动成本(数千美元)低几个数量级。

对科学发现的影响

尽管前沿模型仍然只能解决不到三分之一的问题,但它们展示了在具有挑战性的任务上取得部分进展的能力。OpenAI 表明,当前的失败模式——进行观察但难以将其整合到更广泛的背景中——反映了人类新手与专家之间的差异。

如果 AI 代理能够可靠地自动化这些分析,它将通过加速假设筛选、目标优先级以及数据生成与决策之间的迭代周期来转变工业研究,从而将科学发现的瓶颈从数据生成转移到可操作洞察的提取。

Sources