Anthropic 正在启用 AI 安全等级 3 (ASL-3) 保护措施

Anthropic 为 Claude Opus 4 启用 ASL-3 保护措施

Anthropic 已为 Claude Opus 4 的发布启用了 AI 安全等级 3 (ASL-3) 部署与安全标准。由于模型能力的持续提升,公司无法明确排除 ASL-3 风险——特别是涉及化学、生物、放射性及核武器 (CBRN) 的风险——因此采取了这一预防性和临时性的行动。

负责任的扩展政策 (RSP) 框架

Anthropic 的 AI 安全等级 (ASL) 标准受其负责任的扩展政策 (RSP) 管理,该政策规定,当模型达到特定的“能力阈值”时,必须实施更高等级别的保护。

  • 部署措施: 这些措施针对特定的滥用类别,主要侧重于降低模型协助开发或获取 CBRN 武器的风险。
  • 安全控制: 这些措施旨在防止模型权重被盗。

虽然之前的所有模型都是在基准 AI 安全等级 2 (ASL-2) 标准下部署的,但 Claude Opus 4 是第一个在 ASL-3 标准下部署的模型。Anthropic 已排除 Claude Opus 4 对 ASL-4 标准的需求,并确定 Claude Sonnet 4 不需要 ASL-3 保护措施。

ASL-3 部署措施:防止 CBRN 滥用

ASL-3 部署措施专门针对防止 Claude Opus 4 协助完成端到端的 CBRN 工作流,即提供超出大语言模型无法实现的能力的增值工作流。这些措施专门针对“通用越狱 (universal jailbreaks)”——即用于提取长链 CBRN 相关信息的系统性攻击。

为了实现这一目标,Anthropic 实施了三部分策略:

1. 加固系统以抵御越狱

Anthropic 使用 Constitutional Classifiers,这是基于有害和无害的 CBRN 相关提示词 (prompts) 和补全内容的合成数据训练的实时防护器。这些分类器通过监控输入和输出,以适度的计算开销来拦截有害的 CBRN 信息。

2. 越狱检测

通过专门针对 Constitutional Classifiers 进行压力测试的漏洞赏金计划,结合离线分类系统和威胁情报合作伙伴关系,加强了监控工作,以便快速识别通用越狱。

3. 迭代防御改进

Anthropic 通过生成模拟已发现攻击的合成越狱数据,并利用这些数据训练更新后的分类器,从而修复越狱漏洞。

ASL-3 安全控制:保护模型权重

ASL-3 下的安全控制旨在防御试图窃取模型权重的复杂非国家行为体。该框架包含超过 100 种结合了预防与检测的不同安全控制措施。

关键安全措施包括:

  • 标准最佳实践: 权重访问的双人授权机制、强化的变更管理协议,以及针对终端软件的二进制白名单机制。
  • 流出带宽控制: 一种专门的控制措施,用于限制从安全计算环境中流出的数据流。由于模型权重体积巨大,限制出站网络流量可以使 Anthropic 能够检测并拦截可能表明存在数据窃取企图的异常带宽使用情况。

实施细则与未来展望

Anthropic 主动实施 ASL-3 保护措施,是为了在这些措施成为强制性要求之前完善这些防御手段。公司指出,,由于危险能力评估具有挑战性,且随着模型接近关注阈值,确定其确切状态需要更长的时间。

如果进一步评估得出结论,Claude Opus 4 未能超过相关的能力阈值,Anthropic 可能会调整或移除这些 ASL-3 保护措施。公司打算继续迭代这些措施,并与行业合作伙伴、政府及公民社会合作,以改进 AI 防护方法。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch