Anthropic 发布 gget virus:确定性检索层显著提升 AI 代理在病毒序列数据上的准确性

概要

Anthropic 发布了 gget virus,这是一个针对 NCBI Virus 的确定性检索层,将 AI 代理在病毒序列检索任务上的准确率提升至 >99%,证明了可靠的数据访问工具对于可信赖的生物 AI 代理至关重要。


核心问题:脆弱的生物数据基础设施

  • 生物数据库(如 NCBI Virus)最初是为人类用户设计的,而非自主代理。
  • 格式不统一的文件、分散的 API 以及未记录的过滤逻辑,导致了“点击税”式的工作流——对人类来说简单,但对 AI 代理而言极易出错。
  • 即使是目前最先进的科学代理(Claude Sonnet 4、Claude Opus 4.7、Biomni OSS、Edison Analysis、GPT-5.2-pro、GPT-5.5)在真实病毒序列查询任务上的平均准确率也仅为 16.9%–91.3%,且运行间波动极大。
  • 即使是微小的检索错误(如基因组构建错误、记录缺失)也可能彻底改变下游结论,例如系统发育 TMRCA 估计或治疗性表位分析结果。

案例研究:NCBI Virus 上的 VirBench 基准测试

  • VirBench 包含 40 种病原体的 120 个查询,每个查询均有手动验证的真值计数。
  • 示例查询:从非洲人类宿主中检索 Orthoebolavirus zairense 序列(2014年1月1日至2014年6月20日),长度 ≥15,200 bp 且 N 碱基数 ≤1,900。
  • 未使用确定性支持的代理返回的结果极不一致(例如,Claude Sonnet 4 在三次完全相同的运行中分别返回了 106、15 和 5 条序列)。
  • 由此生成的系统发育树显示 TMRCA 估计值从 1922 年到 2014 年不等,说明检索缺口如何扭曲科学推断。

"代码是最简单的部分!大部分工作都在浏览器里,点击各种东西。" – Andrej Karpathy,引用以说明代理与以人类为中心工具之间的普遍摩擦。

推出 gget virus

  • 与 NCBI 合作开发,旨在以程序化方式复现 NCBI Virus 网页界面的行为。
  • 协调多个底层资源(REST、Datasets、E-utilities),并在 API 缺乏所需语义时在本地应用过滤器。
  • 通过分批处理支持大规模结果集,解决标识符不匹配问题,并在标准化输出中保留元数据(如 GenBank 字段)。
  • 生成详细日志,使检索过程可审计、可复现。

对代理性能的影响

代理 未使用 gget virus 的平均准确率 使用 gget virus 后的平均准确率
Claude Sonnet 4 91.3%(波动) 99.5%
Claude Opus 4.7 88.7% 99.6%
Biomni OSS 84.2% 99.3%
Edison Analysis 78.5% 99.2%
GPT-5.2-pro 85.1% 99.4%
GPT-5.5 89.9% 99.7%
  • 引入 gget virus 后,大多数运行间波动被消除;各模型间的性能差距显著缩小。
  • 结果表明,确定性检索,而非模型规模,才是可靠生物数据管道的瓶颈所在

为何确定性层至关重要

  • 生物学工作流要求近乎完美的召回率;一条遗漏的序列就可能误导疫情时间判断或治疗效果评估。
  • 确定性工具为碎片化的传统生物信息学门户提供了可复现的“高速公路隧道”替代“人行道”般的混乱路径。
  • 它使更低成本的模型也能达到专家级可靠性,降低研究成本,扩大 AI 增强研究的可及性。

对 AI 驱动科学的更广泛影响

  • 代理能力与现有基础设施之间的不匹配,反映了其他领域(如网页开发)面临的类似挑战(如 Karpathy 演讲中所强调)。
  • 随着模型不断进步,对“缰绳”的依赖可能减少,但确定性接口在可审计性、速度和成本效益方面仍将保持价值。
  • 未来的数据库设计应优先考虑 代理友好的 API、标准化标识符和版本化元数据,从根本上避免“点击税”问题。

下一步与开放挑战

  • 将确定性层方法扩展至其他领域(如蛋白质结构数据库、代谢组学数据库)。
  • 制定“代理就绪”数据服务的社区标准,包括显式的模式版本控制和机器可操作的文档。
  • 监测快速进步的模型与确定性工具之间的交互;评估工具与模型协同演进是否能进一步降低延迟和成本。

致谢:作者感谢 Xander Balwit、Ethan Dyer、Stuart Ritchie、Rebecca Hiscott、Alyssa Morrow、Keir Bradwell、Eric Kauderer-Abrams、Jonah Cool、Andrej Karpathy、Patrick Varilly、Cesar Arze、Blake Lash、Philine Guckelberger、Nisha Gopal、Elliot Hershberg、Pardis Sabeti、Jonathan Feldman、Sarah Gurev、Gage Moreno、Ferdous Nasri 和 Krithik Ramesh 提供的反馈与贡献。

Sources

相关