Anthropic 前沿红队进展报告

Anthropic 的前沿红队观察到,AI 模型在双用途能力方面正显示出快速进展的“早期预警”迹象,特别是在网络安全和生物学领域。虽然模型在网络安全方面的技能正接近或超过本科水平,并在某些生物领域具备专家级知识,但目前尚未达到产生实质性提升的国家安全风险阈值。

网络安全能力的快速提升

AI 在网络领域的能力在一年内已从基础水平过渡到本科水平的熟练度。这一进展通过 Capture The Flag (CTF) 练习和公开基准测试的表现得到了证实:

  • CTF 表现: 在不到一年的时间里,Claude 从解决不到 25% 的 Intercode CTF 挑战(专为高中生设计)进步到几乎能解决所有挑战。
  • Cybench 基准测试: Claude 3.7 Sonnet 在五次尝试内能解决大约三分之一的 Cybench 挑战,相比去年顶尖模型的 5% 成功率有了显著提升。
  • 任务多样性: 在多个类别中都观察到了进步,包括发现并利用远程服务器中的漏洞 ("pwn")、Web 应用 ("web") 以及加密协议 ("crypto")。

尽管取得了这些进步,但在逆向工程二进制可执行文件以及在没有协助的情况下在网络环境中进行侦察和利用方面,Claude 仍然落后于人类专家。

网络规模的网络操作

通过与卡内基梅隆大学合作,Anthropic 测试了模型在由大约 50 个主机组成的真实网络靶场中的表现。虽然模型目前还不能在这些环境中自主成功,但如果配备了像 Incalmo 这样的专业软件工具,它们可以模拟大规模的个人身份信息窃取(类似于 Equifax 数据泄露事件)。这种基础设施允许 Anthropic 监控自主能力提升的时刻。

生物安全知识的进展与差距

Claude 在生物学理解方面的进展迅速,在一年内从表现不及世界级病毒学专家的水平,进步到在 VCT 评估(解决病毒学任务故障)中轻松超过该基准线。

生物学专业知识 vs. 实际风险

生物学能力在不同任务中表现不一:

  • 优势: Claude 3.7 Sonnet 在理解生物协议和操作 DNA 及蛋白质序列方面接近人类专家基准,并且在克隆工作流程方面超过了人类专家基准。
  • 劣势: 模型在解释科学图表方面仍然逊于人类专家。

关于武器化风险,小型受控研究表明,虽然与仅能访问互联网的模型相比,最新的模型为新手提供了某种程度的提升,但生成的计划仍包含会导致现实世界失败的关键错误。专家红队测试结论认为,目前规划中的关键错误数量过多,尚不足以使恶意新手能够端到端地执行攻击。

战略合作伙伴关系与安全框架

Anthropic 利用负责任的扩展政策 (RSP) 来承诺达到触发更高安全级别的能力阈值。为了验证这些风险,实验室通过几种外部合作伙伴关系进行验证:

  • AI 安全/安全研究所: 模型在部署前会接受美国和英国 AI 安全研究所 (AISI) 的测试,这些测试为 Claude 3.7 Sonnet 的 AI 安全级别 (ASL) 判定提供了依据。
  • National NNSA (NNSA): Anthropic 与美国能源部的 NNSA 合作,在机密环境中评估 Claude 在核能与放射性风险知识方面的表现。

未来展望与风险缓解

Anthropic 正在扩大规模,进行更频繁、自动化的评估,以尽早检测到风险。实验室指出,随着模型在“思维扩展”方面的提升,随着模型变得更加“开箱即用”且能力更强,对 Incalmo 等外部工具包的需求可能会减少。

基于目前的生物学研究,Anthropic 认为其模型正在接近需要 AI 安全级别 3 (ASL-3) 防护措施的能力阈值,这促使了对必要安全措施的投入增加。

Sources

相关