Anthropic 与美国 CAISI 及英国 AISI 在 AI 安全防护方面的合作

Anthropic 已与美国 AI 标准与创新中心 (CAISI) 以及英国 AI 安全研究所 (AISI) 建立了持续的合作伙伴关系,旨在识别并缓解其 AI 模型中的漏洞。此次合作利用了政府在国家安全、网络安全和威胁建模方面的专业知识,以提高 AI 安全防护措施在应对复杂滥用行为时的鲁棒性。

通过红队测试强化宪法分类器 (Constitutional Classifiers)

Anthropic 利用 CAISI 和 AISI 对其宪法分类器(用于检测和防止越狱行为的防御系统)的多个迭代版本进行了评估,评估对象包括 Claude Opus 4 和 4.1 等模型,并在其部署前完成。这一迭代式的压力测试过程发现了几个关键的漏洞类别:

  • 提示词注入 (Prompt Injection): 政府红队人员识别出了某些弱点,例如通过虚假声称已进行过人工审核的特定注释,可以绕过分类器的检测。
  • 通用越狱 (Universal Jailbreaks): 测试人员开发了复杂的越狱手段,通过对有害交互进行编码来规避标准检测。这促使 Anthropic 从根本上重构了其安全防护架构,而非仅仅应用简单的补丁。
  • 基于密码的攻击 (Cipher-based Attacks): 使用密码、字符替换和其他混淆技术来规避分类器,这促使检测系统进行了改进,使其能够识别无论如何编码的伪装内容。
  • 输入与输出混淆 (Input and Output Obfuscation): 测试人员发现了通用越狱手段,即将有害字符串碎片化为较大上下文中的良性组件,从而导致了对过滤机制的有针对性的改进。
  • 自动化攻击优化 (Automated Attack Refinement): 合作伙伴开发了自动化系统,以逐步优化攻击策略,从而产生有效的通用越狱手段,Anthropic 目前正利用这些手段来改进其安全防护措施。

增强风险方法论与评估

除了特定的技术漏洞外,与 CAISI 和 AISI 的合作还改进了 Anthropic 更广泛的安全方法。政府机构提供了关于部署监控、快速响应能力和证据要求的外部视角,这有助于压力测试 Anthropic 的内部威胁模型,并识别出需要更多证据的领域。

有效的政企合作框架

Anthropic 认为,以下几个关键因素使得此次与政府研究和标准机构的合作伙伴关系能够发挥效力:

全面的系统访问权限

提供深度的系统访问权限可以实现更复杂的漏洞发现。Anthropic 向政府红队人员提供了以下资源:

  • 部署前原型 (Pre-deployment Prototypes): 访问安全防护原型的权限,使得弱点可以在系统上线前被识别。
  • 多样化的系统配置 (Diverse System Configurations): 测试人员可以访问从完全未受保护的基础模型到具有完整安全防护的模型,从而允许他们逐步细化攻击手段。
  • 内部文档 (Internal Documentation): 关于安全防护架构、已记录漏洞以及细粒度内容政策信息的透明度,有助于测试人员针对高价值领域进行测试。
  • 实时数据 (Real-time Data): 直接访问分类器评分,使得测试人员能够优化攻击策略并进行有针对性的探索性研究。

迭代且持续的参与

持续的合作,包括每日沟通和频繁的技术深挖,使得外部团队能够培养出必要的深度系统专业知识,从而发现单次评估无法发现的复杂漏洞。

多层防御策略

Anthropic 将专门的政府评估与其它安全措施(如公开的漏洞赏金计划)相结合。虽然漏洞赏金计划可以从广泛的人才库中获得大量且多样化的报告,但政府团队则提供了发现细微、复杂的攻击向量所需的深度技术知识。

Sources

相关