使用 BioMysteryBench 评估 Claude 的生物信息学研究能力

Anthropic 开发了 BioMysteryBench,这是一个全新的生物信息学基准测试,旨在评估 AI 模型是否能够利用真实世界的数据集解决复杂的、开放式的研究问题。评估结果显示,Claude 的科学能力正随着代际更迭迅速提升,最新模型在表现上已能与人类专家并驾齐驱,并解决了若干人类专家小组无法解决的问题。

评估生物信息学研究的挑战

评估科学领域的 AI 非常困难,因为传统的基准测试往往无法捕捉到真实研究中那种杂乱、开放式的本质。Anthropic 指出了创建规范科学基准测试的三个主要障碍:

  • 方法论的多样性: 在生物学中,基于研究人员的背景和可用资源,通常有多种“正确”的方法来解决一个问题。
  • 主观性与噪声: 生物数据集通常包含噪声,这意味着在主观研究决策中的微小差异可能会导致完全不同的结论。
  • 人类知识的差距: 最具影响力的研究任务往往是人类尚未解决的任务,这使得无法仅将人类的表现作为唯一的标准答案(ground truth)。

BioMysteryBench:一个可验证的科学框架

BioMysteryBench 由不同生物信息学领域的领域专家编写了 99 个问题。为了克服上述评估挑战,该基准测试采用了四个关键特性:

  1. 与方法无关的评分: Claude 的评分基于最终答案,而非其采取的具体分析路径,这为研究创造力留出了空间。
  2. 客观的标准答案: 答案源自数据中可控的属性或经过验证的元数据(例如 PCR assays),而非主观的科学结论。
  3. 超人类的问题生成: 由于答案基于数据属性,该基准测试包含了一些客观上可解但对人类专家而言过于困难的问题。
  4. 工具赋能的环境: Claude 被置于一个包含规范生物信息学工具的容器中,能够通过 pip 和 conda 安装新工具,并可以访问 NCBI 和 Ensembl 等数据库。

这些问题主要集中在 DNA 和 RNA 测序数据(WGS, scRNA-seq, methylation, ChIP-seq, metagenomics, Hi-C),以及蛋白质组学和代谢组学。

性能对比:AI vs. 人类专家

Anthropic 通过指派多达五名领域专家来回答每个问题,从而为该基准测试建立了基准线。这将被任务分为两类:

人类可解的任务

在至少一名人类可以解决的 76 项任务中,Claude 表现出了强大的性能,其策略往往与人类相似。在某些情况下,Claude 使用“直觉”来识别模式或序列——类似于 TATA box 的发现过程——这与传统的算法方法有所不同。

人类困难的任务

在专家无法解决的剩余 23 个问题中,Claude Sonnet 4.6 和更先进的模型解决了相当一部分。Claude Mythos Preview 在这些人类困难的问题上实现了 30% 的解决率。

Claude 研究策略的分析

通过对 Opus 4.6 的对话记录进行分析,发现了两种让 Claude 在困难任务上超越人类的主要策略:

  • “无所不知”的方法: Claude 利用其在结构生物学、分子特征和来自数十万篇论文的元分析方面的庞大内部知识,来解决那些需要人类手动整合多个数据库的问题。
  • 证据分层法: 当不确定时,Claude 会采用多种不同的方法进行分层,并最终收敛于由多条证据链支持的答案。

可靠性与能力边界

通过使用 Claude Mythos Preview 分析数据,Anthropic 发现两组任务在“获胜”的可靠性方面存在显著差异:

  • 可靠的获胜: 在人类可解的问题上,Opus 4.6 在其成功的案例中,至少有 5 次中有 4 次都能解决,表明其方法是可靠的。
  • 脆弱的获胜: 在人类困难的问题上,“脆弱的获胜”(仅在 5 次中有 1-2 次解决)的比例跃升至 44%。

这表明,虽然模型可以攻克最难的问题,但它们往往是通过“运气”驱动的推理路径,而非始终如一的可重复解决方案。

行业趋同与未来展望

Anthropic 指出,这些结果与 Genentech 和 Roche 发布的类似基准测试 CompBioBench 相呼应。在那个评估中,Claude Opus 4.6 达到了 81% 的整体准确率,并在最难的问题上达到了 69% 的准确率,这进一步强化了前沿模型作为生物信息学研究中有用协作者的角色。

Sources

相关