Anthropic 宪法分类器:防御通用越狱攻击
摘要
Anthropic 推出了 宪法分类器,这是一种基于分类器的安全防护机制,在仅导致 0.38% 的过度拒绝率上升和约 24% 的计算成本增加的情况下,能够阻止超过 95% 的 Claude 3.5 Sonnet 面对的通用越狱尝试。
什么是宪法分类器?
宪法分类器是两个独立的神经分类器——一个用于输入,一个用于输出——它们在由一份 宪法 生成的大规模合成数据集上进行训练,该宪法列出了允许和禁止的内容类别(例如,芥末食谱是允许的,但芥子气食谱则不允许)。这些分类器会在语言模型生成或返回内容之前,标记并阻止任何违反宪法的提示或响应。
"两种技术都使用宪法:一份模型应遵循的原则清单。在宪法分类器的情况下,这些原则定义了允许和禁止的内容类别。"
训练流程
- 宪法创建 – 人工制定的无害与有害内容类别的列表,最初聚焦于化学、生物、放射性和核(CBRN)威胁。
- 合成数据生成 – Claude 为每个类别生成数百万个提示-完成对,然后通过语言翻译、风格变化(包括已知的越狱风格)和编码技巧进行增强。
- 平衡数据集 – 添加一组固定的良性查询(来自承包商),以保持过度拒绝率较低。
- 分类器训练 – 训练输入和输出分类器,以预测提示或响应是否属于被禁止的类别。
- 部署 – 在推理时,分类器作为模型的门控机制:被拒绝的提示永远不会到达 Claude;被拒绝的完成内容在发送给用户前被丢弃。
人工红队评估(原型阶段)
- 设置:独立的越狱攻击者参与了一个漏洞赏金计划,试图迫使受原型分类器保护的 Claude 3.5 Sonnet(2024 年 6 月版)回答十个预设的“禁止”问题。
- 投入:183 名参与者在两个月内累计投入超过 3,000 小时,成功实现通用越狱可获得 15,000 美元奖励。
- 结果:没有任何参与者能够仅用一次越狱就获取全部十个问题的详细答案;因此,未发现通用越狱。
- 局限性:原型表现出对无害查询的高过度拒绝率,并带来显著的计算成本,促使进行了第二轮迭代。
自动化合成评估(更新后的系统)
- 数据集:10,000 个合成生成的越狱提示,涵盖最有效的已知攻击和新型分类器规避技术。
- 基线:未使用分类器时,Claude 3.5 Sonnet(2024 年 10 月版)允许了其中 86% 的提示。
- 使用宪法分类器:成功率降至 4.4%,意味着超过 95% 的越狱尝试被阻止。
- 过度拒绝影响:无害查询的拒绝率上升了 0.38%,在 5,000 次对话样本中该变化无统计显著性。
- 计算开销:推理成本增加了 23.7%,被描述为中等水平。

实时演示(2025 年 2 月 3 日至 10 日)及真实世界红队发现
- 参与人数:339 名越狱攻击者生成了超过 30 万次聊天交互(约 3,700 小时)。
- 成功案例:四名参与者清除了全部八个挑战等级;一人实现了 通用 越狱,另一人实现了接近通用的越狱。
- 常见策略:
- 使用密码和编码技巧绕过输出分类器。
- 角色扮演系统提示。
- 关键词替换(例如,“Soman” → “water”)。
- 提示注入攻击。
- 自动评分器表现:整体上拒绝了约 1% 的提交(第 4 题为 10%)。若通过去混淆重新评分,约 0.26% 的案例结果可能发生变化。
- 奖金:向四位成功参与者支付了总计 55,000 美元(完成所有等级奖励 10,000 美元,通用越狱奖励 20,000 美元,另有额外奖励)。

局限性与未来工作
- 覆盖不全:宪法分类器无法保证零通用越狱;剩余攻击仍需更多努力才能发现。
- 持续演化的威胁:可能出现新的越狱技术,需要补充防御措施(例如外部监控、动态响应策略)。
- 可适应性:底层宪法可快速更新,以纳入新型攻击模式。
- 持续目标:进一步降低过度拒绝率,减少计算开销,并在投入生产前将分类器与其他安全层集成。
该系统在 Anthropic 安全路线图中的定位
根据 Anthropic 的 负责任扩展政策,一旦风险(包括 CBRN 相关危害)被降低至可接受水平,模型即可部署。宪法分类器旨在为已跨越 CBRN 能力阈值的模型提供必要的缓解措施,从而实现更安全地扩展日益强大的大语言模型。
访问演示
一个由宪法分类器保护的 Claude 3.5 Sonnet 实时演示曾可通过以下 URL 访问(现已归档): https://claude.ai/redirect/website.v1.082e291e-714e-4b74-8d3d-6bb3e9114f91/constitutional-classifiers
参考文献
- 论文:宪法分类器:防御通用越狱攻击 (arXiv 2501.18837) – https://arxiv.org/abs/2501.18837
- 相关工作:宪法 AI (arXiv 2212.08073) – https://arxiv.org/abs/2212.08073
- 漏洞赏金计划:https://www.anthropic.com/news/model-safety-bug-bounty
- 负责任扩展政策:https://www.anthropic.com/news/announcing-our-updated-responsible-scaling-policy
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch