Claude 将开源生物分子模型的推理速度提升 4 倍,并实现单张 GPU 上超过 10,000 个 token 的预测

TL;DR

Anthropic 发布了一套由 Claude 驱动的优化方案,使 30 多个开源生物分子建模工具平均提速约 4 倍,内存占用显著降低,可在单张 NVIDIA GPU 上预测超过 10,000 个 token 的结构,并宣布与 Adaptyv Bio 联合赞助一项高达 100 万美元的蛋白质设计竞赛。


由 Claude 驱动的推理加速

关键成果: Claude 加速了 30 多个用于结构预测、蛋白质设计、蛋白质语言建模和基因组学的深度学习模型,平均提速约 4 倍,精度损失极小(精度完全一致时提速约 1.6 倍)。整个工作在不到四周内完成,而通常每个模型需数周工程开发。

  • Claude 作为通用研究模型,由两名 Anthropic 的领域专家指导,且无先前内核工程经验。
  • 优化包括三角注意力和乘法的自定义内核(FlashPairformer)、冗余计算结果缓存,以及死代码路径剪枝。
  • 加速后的模型在蛋白质结构预测等下游任务中保持原有性能。

"Claude 加速了十余个生物分子结构预测模型,平均实现约 4 倍提速,精度下降极小;在输出完全一致的情况下,提速约 1.6 倍。" – Anthropic 博客文章

FlashPairformer:用于三角运算的自定义内核

关键成果: 由 Claude 生成的一组内核 FlashPairformer,在三角注意力上比行业标准 cuEquivariance 实现 2.7–2.9 倍提速,在三角乘法上实现 1.7–3.2 倍提速,具体取决于模型配置。

  • 三角注意力和乘法在 AlphaFold 类模型中占据主要运行时间和内存,因其随 token 数量呈立方级增长。
  • 通过重写这些内核,Claude 实现了 Pairformer 架构的最先进性能。

Claude 的 FlashPairformer 内核相较于 cuEquivariance 的提速效果

适用于大规模生物分子系统的低内存“Big”模式

关键成果: Claude 引入了低内存“Big”模式,可在单张 NVIDIA GPU 节点上准确推理超过 10,000 个 token 的系统,并在单张 B300 节点上成功推理高达 70,000 个 token 的系统。

  • 在人类线粒体复合物 I、TRiC 分子伴侣、蛋白酶体和细菌核糖体(均超过 10,000 个 token)上实现了准确预测。
  • 相较于 AlphaFold 3 对 7,663 个 token 的 40S 核糖体预测,Claude 的 Big 模式将规模上限提升了约 1.5 个数量级。
  • 当推至 31,000–70,000 个 token 的病毒衣壳和蛋白质区室时,预测失败,表明其泛化能力远超训练上下文,但计算门槛已大幅降低。

使用 Claude 的 Big 模式折叠的大分子复合物

高效的从头蛋白质结合剂设计

关键成果: 使用单张 NVIDIA H200 GPU 上的单个 Claude 模型运行 24 小时,Anthropic 成功复现了其早期 Mythos 5.1 实验的体外结合评分,但 GPU 使用时间减少约 100 倍,总 GPU + token 成本约为 150 美元。

  • 在 16 个靶点上评估了三种 Claude 变体(Mythos 5.1、Mythos 5、Opus 5)。
  • 中位数和最佳 ipSAE 得分与之前多智能体、每靶点 10,000 美元的实验结果相当。
  • 这表明 Claude 加速的生物分子栈可在大幅降低计算成本的前提下,实现相当的设计质量。

Claude 的 ipSAE 性能与 GPU 成本对比

开源发布与社区竞赛

  • 所有 30 多个模型的优化代码已发布至 https://github.com/anthropics/uplifting-biomolecular-modeling。
  • 一份详细的技木报告(PDF)提供了基准测试方法和完整结果。
  • Anthropic 与 Adaptyv Bio 联合赞助蛋白质设计竞赛,最高可提供 100 万美元 Claude 信用额度、25 万美元 Modal 计算信用额度,以及超过 5,000 个设计的湿实验验证。竞赛聚焦于跨物种反应性、pH 敏感性、肽-MHC 特异性及 GPCR 设计等挑战性问题。

"我们承诺最高 100 万美元 Claude 信用额度和 25 万美元 Modal 计算信用额度,以及超过 5,000 个设计的湿实验验证。" – Anthropic 官方公告

对生命科学社区的影响

  1. 高性能建模的民主化 – 研究人员现在可在单张 GPU 上运行最先进的结构预测与设计流程,降低了无大型计算集群实验室的准入门槛。
  2. 加速发现周期 – 更快的推理速度和更低的 GPU 成本,使每个项目可进行更多设计迭代,有望缩短从体外构想到实验验证的时间。
  3. 推动开放科学协作 – 开源发布与竞赛提供了共享基准和激励机制,有助于将社区努力聚焦于可复现、高影响力的蛋白质工程。

更多资源


本文忠实总结了 Anthropic 2026 年 9 月的研究公告,未添加或更改任何事实内容。

Sources