Anthropic ASL-3 安全防御漏洞赏金计划

Anthropic 推出了一个漏洞赏金计划,旨在对旨在防止 AI 被滥用于化学、生物、放射性及核(CBRN)武器的安全分类器进行压力测试。该计划是 Anthropic 为满足其《负责任扩展政策》(Responsible Scaling Policy)中定义的 AI 安全等级-3(ASL-3)部署标准而采取的努力的一部分。

压力测试宪法分类器

Anthropic 正利用与 HackerOne 合作管理的漏洞赏金计划,来测试其 Constitutional Classifiers 系统的更新版本。Constitutional Classifiers 旨在通过遵循一套基于特定危害定义允许和不允许内容的原则,来防御可能诱导 CBRN 武器相关信息的越狱攻击。

在计划的初始阶段,参与者获得了在 Claude 3.7 Sonnet 上测试这些分类器的早期访问权限。该计划为经过验证的通用越狱(universal jailbreaks)——即在多个主题上都能持续绕过安全措施的漏洞——提供高达 25,000 美元的奖励,特别是那些能够实现 CBRN 相关主题滥用的漏洞。

与负责任扩展政策(RSP)的一致性

该漏洞赏金计划是《负责任扩展政策》(RSP)框架的直接应用,该框架管理着 Anthropic 如何开发和部署能力日益增强的模型。公司表示,随着模型能力的提升,它们可能需要 ASL-3 标准中概述的高级安全和安全保护措施。该计划作为一种在这些 ASL-3 防护措施公开部署之前进行迭代和压力测试的方法。

计划的演进与扩展

在 2025 年 5 月 18 日初始计划结束后,Anthropic 于 2025 年 5 月 22 日宣布了一项更新,将该计划过渡到新阶段。这一新的仅限受邀参与的计划侧重于:

  • Claude Opus 4 测试: 在新的 Claude Opus 4 模型上对 Constitutional Classifiers 系统进行压力测试。
  • 通用安全系统: 测试目前正在开发的其它安全系统。
  • 公开报告收集: Anthropic 现在接受有关在公共平台或论坛(如社交媒体)上发现的、针对 ASL-3 关注用途的通用越狱报告——特别是那些诱导生物威胁相关信息的越狱。

参与要求

参与漏洞赏金计划采取仅限受邀的方式,以确保及时的反馈和响应。Anthropic 鼓励在识别语言模型越狱方面具有证明过的专业知识的经验丰富的红队人员和研究人员申请受邀。

Sources

相关