Anthropic 语言模型红队测试报告 – 方法、缩放行为与经验教训
TL;DR
Anthropic 的新报告发现,随着参数量从 2.7B 增长到 52B,经过 RLHF 训练的语言模型对红队攻击的抵抗力越来越强,而普通模型、仅通过提示词引导的“helpful”模型以及拒绝采样模型则没有表现出明显的缩放趋势;团队还发布了一个包含 38,961 次攻击的数据集和一个完整的的方法论指南,以加速社区的安全工作。
缩放行为的关键发现
RLHF 模型随规模增长而变得更难进行红队测试。 在 2.7B、13B 和 52B 三种规模下,Anthropic 观察到,针对经过人类反馈强化学习训练的模型,成功的有害提示词数量呈单调递减。这表明,随着模型容量的扩大,RLHF 为对抗性探测提供了越来越强的鲁棒性。
其他模型类型表现出平缓的缩放趋势。 普通语言模型、被提示为“helpful, honest, and harmless”的模型以及使用拒绝采样的模型,在相同的规模范围内并未表现出系统性的红队测试能力变化。无论参数量多少,它们对有害输出的敏感度基本保持不变。
数据集发布
38,961 次红队攻击现已公开。 Anthropic 发布了研究期间收集的全套对抗性提示词及其对应的模型输出。该数据集涵盖了从明显的攻击性语言到微妙的、非暴力的不道德内容等一系列有害行为,为未来的安全研究提供了宝贵的基准。
方法论概述
指令与过程透明度。 报告详尽地记录了红队测试指令、参与者招募、提示词生成工作流以及统计分析技术。它还讨论了不确定性的来源,例如标注者之间的一致性差异以及自动检测的局限性。
统计严谨性。 Anthropic 采用置信区间和假设检验来比较不同模型家族和规模下的攻击成功率,以确保观察到的趋势并非样本方差造成的偶然现象。
对 AI 安全社区的启示
RLHF 可以随规模提升安全性的证据。 RLHF 模型攻击成功率的下降支持了这样一个假设:通过人类反馈对模型进行对齐,可以产生可扩展的安全收益。
需要共享标准。 通过发布数据集和详细的方法论手册,Anthropic 鼓励社区规范的制定、可重复的红队测试实践以及评估模型危害的技术标准。
更广泛的研究背景。 该报告是 Anthropic 更大安全研究组合的一部分,其中包括对多智能体系统失效、员工再培训证据以及 Claude 模型高级数学能力的研究。
资源
- 完整红队测试政策备忘录:Anthropic_RedTeaming.pdf
- 关于多智能体系统风险的相关研究:https://www.anthropic.com/research/multiagent-systems
- 员工再培训计划回顾:https://www.anthropic.com/research/reviewing-the-evidence-on-worker-retraining-programs
- Claude 在黎曼猜想上的数学进展:https://www.anthropic.com/research/riemann-zeta
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch