Anthropic 为网络防御者构建 AI

Anthropic 开发了 Claude Sonnet 4.5,专门侧重于增强其面向防御者的网络安全能力,使该模型在发现代码漏洞方面的性能能够匹配甚至超越更大的 Claude Opus 4.1。这一转变反映了一个拐点,即前沿 AI 越来越有能力执行高级网络任务,因此需要加速开发 AI 驱动的防御工具,以保持与 AI 增强型攻击者的对等地位。

Claude Sonnet 4.5 中增强的网络能力

Claude Sonnet 4.5 的开发是通过专门针对关键防御技能(如代码漏洞发现和修复)进行研究,而不是仅仅依赖于通用模型的规模扩展。虽然网络安全技能通常是通用训练的副产品,但 Anthropic 专注于这些领域,以确保防御者配备了比以往的前沿模型更快、更便宜的高性能工具。

在 Cybench 上的表现

在基于夺旗赛 (CTF) 挑战的基准测试 Cybench 的评估中,Claude Sonnet 4.5 表现出比以往版本显著的改进:

  • 成功率: 在每个任务给予 10 次尝试机会时,Sonnet 4.5 实现了 76.5% 的成功率,是 Sonnet 3.7(2025 年 2 月发布)35.9% 成功率的两倍多。
  • 效率: Sonnet 4.5 在单次尝试中实现的成功概率比 Opus 4.1 在十次尝试中实现的还要高。
  • 复杂工作流: 该模型在 38 分钟内成功解决了一个涉及网络流量分析、恶意软件提取和解密的复杂任务——据估计,这项任务至少需要一名熟练的人类专家花费一个小时。

在 CyberGym 上的表现

使用测试在开源软件中发现已知和新漏洞能力的 CyberGym 基准测试,Claude Sonnet 4.5 创下了新的性能记录:

  • 已知漏洞: 在每个漏洞 $2 的 API 查询限制下,Sonnet 4.5 实现了 28.9% 的最先进水平得分。当移除限制并允许 30 次试验时,成功率上升至 66.7%。
  • 新漏洞发现: 在单次试验中,Sonnet 4.5 在 5% 的案例中发现了新漏洞,在给予 30 次试验时,这一比例增加到超过 33% 的项目。这与 Sonnet 4 相比有了显著提升,后者在约 2% 的目标中发现了漏洞。

对自动化修复的研究

Anthropic 正在对该模型生成和审查修复补丁 (patch) 的能力进行初步研究。修复补丁被认为是一项比发现漏洞更困难的任务,因为它需要进行精确的改动,在没有明确规范的情况下保持原始功能不变。

初步实验表明,Claude Sonnet 4.5 生成的补丁中有 15% 被判定为在语义上与人类编写的参考补丁等效。手动分析确认,其中一些得分最高的补丁在功能上与合并到开源软件中的补丁完全相同,这表明补丁生成是一种可以通过针对性研究进一步完善的涌现能力。

现实世界应用与行业反馈

Anthropic 与安全组织合作,在现实世界的挑战中测试了 Claude Sonnet 4.5。关键反馈包括:

  • HackerOne: 报告称,Claude Sonnet 4.5 使其 Hai 安全代理的平均漏洞摄取时间减少了 44%,同时将准确性提高了 25%。
  • CrowdStrike: 指出该模型在红队测试 (red teaming) 和生成创意攻击场景方面具有潜力,可以加速对跨越端点、身份、云端和 AI 工作负载的攻击者战术 (tradecraft) 的研究。

网络安全领域的战略意义

Anthropic 指出,组织需要采用 AI 进行防御,以避免将优势让给恶意行为者。这一点可以从威胁行为者使用 AI 进行大规模数据勒索和针对关键电信基础设施的复杂间谍活动(其中一些与中国 APT 运营相关)的破坏性中得到证实。为了应对这一点,Anthropic 建议将 AI 集成到 CI/CD 流水线中进行自动化安全审查,并扩大其在安全运营中心 (SOC) 自动化、安全信息和事件管理 (SIEM) 分析以及主动防御中的应用。其目标是将 AI 在网络安全中的角色从未来的担忧转变为当下的紧迫任务,通过设计来实现数字基础设施的安全。

Sources

相关