Anthropic 研究:衡量大语言模型的漏洞利用开发能力

概要

Anthropic 评估了 Claude Mythos Preview 的漏洞利用开发能力,发现其能够针对广泛使用的软件构建完整的端到端攻击链。这一能力相比此前的前沿模型实现了显著飞跃,表明漏洞利用所需的专门知识将随着这些能力的普及而逐渐降低。

通过 ExploitBench 对 V8 引擎的利用

Claude Mythos Preview 是唯一在测试中能够可靠地逃逸 V8沙箱并实现任意代码执行(ACE)的模型。利用 ExploitBench 框架——该框架在五个层级(覆盖率、复现、目标原语、通用原语和完全控制)中衡量 16 项不同能力——Mythos Preview 在 41 个测试的 CVE 中成功实现了 ACE,共 21 个。

V8 评估的关键发现包括:

  • 沙箱逃逸:虽然大多数模型可以触发漏洞,但 Mythos Preview 是唯一一个能稳定地从 T3(沙箱原语)推进到 T2(通用原语/沙箱逃逸)的模型。
  • 稳定性和新颖性:在某个实例(CVE-2023-6702)中,Mythos Preview 构建了一个近乎确定性的漏洞利用,而现有的公开漏洞利用则是概率性的。一位基准测试作者指出,该模型执行了一个复杂漏洞利用计划,此前人类研究人员因复杂性而将其视为不可行。
  • 性能差距:在基准测试的基线或微调变体中,没有任何其他模型在不使用专有支撑结构的情况下实现任何一次 ACE。

通过 ExploitGym 实现广泛目标的漏洞利用

在使用 ExploitGym 的评估中,该框架涵盖 OSS-Fuzz、V8 引擎和 Linux 内核中的 898 个已修补漏洞,Mythos Preview 展现了在实现未经授权代码执行方面的卓越成功率。

  • 成功率:Mythos Preview 在 157 个任务中成功利用预期漏洞实现未经授权的代码执行,若包含替代漏洞路径,则总计成功捕获 226 个标志。
  • 对比:相比之下,Claude Opus 4.6 仅通过预期漏洞实现 15 次成功,总计捕获 36 个标志。
  • 内核漏洞利用:Mythos Preview 是仅有的两个被报告能频繁开发内核漏洞利用的模型之一。

通过 SCONE-bench 实现智能合约漏洞利用

使用更新的 SCONE-bench 数据集(包含 2026 年 1 月 1 日之后报告的 12 个漏洞),Mythos Preview 在模拟环境中展现出极高的金融盗窃能力。

  • 财务影响:Mythos Preview 利用了价值 3500 万美元的智能合约,比第二接近的模型高出约 75%。
  • 成功率:Mythos Preview 是唯一一个在基准测试中成功利用所有测试漏洞的模型。
  • 增长趋势:模型在智能合约漏洞利用方面的性能翻倍时间已从 Opus 4.5 之前 的 1.1 个月加速至近期模型的 0.7 个月。

对人工智能安全与部署的影响

Anthropic 得出结论:在全局基础设施上开发完整端到端漏洞利用的能力是一项关键能力,需要进行严格、由专家主导的基准测试。为缓解这些风险,Anthropic 已实施多项措施:

  • Project Glasswing:对 Mythos Preview 采取受控发布策略,防止高风险能力的广泛释放。
  • Cyber Verification Program:一个系统,可在保持合法安全研究人员访问权限的同时,阻止潜在恶意网络威胁。
  • 外部研究员访问计划:一项倡议,旨在支持在网络安全领域开发高质量、严谨的评估。

"该模型执行了一个复杂漏洞利用计划,此前人类研究人员因复杂性而将其视为不可行。" — @handle

Sources

相关