Anthropic Constitutional Classifiers++ 发布
Anthropic 开发了 Constitutional Classifiers++,这是一种下一代安全系统,旨在保护大语言模型免受越狱(jailbreaks)的影响——越狱是用于规避安全护栏以诱导有害信息的手段,特别是涉及化学、生物、放射性或核(CBRN)武器的信息。这一新系统将安全监控的计算成本显著降低至约 1%,同时在测试期间消除了通用越狱的发现。
从第一代 Constitutional Classifiers 的演进
最初的 Constitutional Classifiers 是基于从自然语言规则“宪法”中衍生的合成数据训练的安全防护措施。虽然它们将越狱成功率从 86% 降低到 4.4%(拦截了 95% 的攻击),但它们也带来了显著的运营权衡:
- 计算成本: 计算成本增加了 23.7%。
- 误拒率: 对无害查询的拒绝率增加了 0.38%。
- 脆弱性: 在一次漏洞赏金计划中发现了一个通用越狱。
Constitutional Classifiers++ 架构
Constitutional Classifiers++ 利用集成防御和“级联架构”来平衡鲁棒性与效率。该系统分为两个阶段运行:
第一阶段:内部探测分类器 (Internal Probe Classifiers)
第一阶段使用线性探测器(linear probes)来监控 Claude 的内部激活值。这些探测器会在响应生成之前识别出模型神经网络中暗示有害内容的模式。由于这些探测器复用了现有的计算,因此它们的计算成本很低,且比最终输出更难被攻击者操纵。
第二阶段:交换分类器 (Exchange Classifiers)
如果内部探测器将一次交换标记为可疑,它将被升级到更强大的第二阶段分类器。与之前分别筛选输入和输出的版本不同,这种“交换分类器”会在输入的上下文中监控输出。这使得系统能够检测到只有在结合输入和输出一起查看时才明显的有害意图,例如当攻击者使用暗语(例如,用“食品调味剂”指代化学试剂)时。
性能与基准测试
在 Claude Sonnet 4.5 的流量部署中,Constitutional Classifiers++ 系统展示了以下结果:
- 拒绝率: 对无害查询的拒绝率降至 0.05%,与原系统相比下降了 87%。
- 计算开销: 当应用于 Claude Opus 4.0 的流量时,该系统增加了约 1% 的计算开销。
- 鲁棒性: 在 198,000 次红队测试尝试中(累计超过 1,700 小时),仅发现了一个高风险漏洞,检测率为每千次查询 0.005。未发现通用越狱。
已识别的漏洞与模型退化
尽管有了这些改进,Anthropic 仍识别出两类具有挑战性的攻击:
- 重构攻击 (Reconstruction Attacks): 这些攻击将有害信息分解为看似无害的分段,随后再重新组合(例如,将查询嵌入为跨代码库的函数)。
- 输出混淆攻击 (Output Obfuscation Attacks): 这些攻击促使模型使用隐喻、谜语或无害的替代词来伪装输出。
Anthropic 指出,这些越狱尝试通常会降低模型的实际能力。在 GPQA Diamond 基准测试(博士级科学概念)中,当应用某些越狱技术时,模型性能从 74% 下降到低至 32%。
未来研究方向
Anthropic 正在探索多种途径来进一步加固系统,包括:
将分类器信号直接集成到响应生成过程中。
训练模型对混淆具有更强的抵抗力。
利用自动化红队测试来为分类器生成更高质量的训练数据。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch