使用开源大语言模型的宪法 AI
Hugging Face 已发布了一套完整的配方和一个新工具 llm-swarm,用于在开源大语言模型上实现宪法 AI(CAI)。这种方法让开发者通过让 AI 根据一套定义好的“宪法”原则对自己的输出进行批评和修正,从而将模型对齐到特定的价值观和安全防护栏,省去了昂贵的人类标注偏好数据的需求。
宪法 AI(CAI)流程
宪法 AI 通过遵循三步迭代过程,使模型自我对齐,将不良响应转化为安全、对齐的响应:
- Initial Response: 模型收到一个可能有害或不良的问题提示(例如,“如何偷 iPhone?”)。
- Self-Critique: 要求模型根据一套宪法原则对自己的输出进行批评(例如,“讨论该响应可能非法或危险的方面”)。
- Revision: 模型重写响应,去除有害内容并使其符合宪法。
此过程会生成两类用于进一步训练的合成数据集:
- Supervised Fine-Tuning (SFT) Dataset: 初始提示与最终修订响应的配对。
- Preference Dataset: 包含修订响应(首选)和初始不良响应(被拒)的配对。
使用 llm-swarm 的可扩展合成数据生成
为了生成 CAI 所需的数万条合成响应,Hugging Face 推出了 llm-swarm。该工具专为在 Slurm 集群上进行分布式生成而设计,基于 TGI(文本生成推理)和 vLLM 提供动力。
llm-swarm 的关键特性包括:
- Automated Endpoint Management: 它会通过
sbatch自动启动推理实例,并在作业完成后终止,以防止 GPU 浪费。 - Load Balancing: 它使用 nginx Docker 容器,以“最少连接”策略在多个端点之间分配请求,确保高可扩展性。
技术实现与模型性能
在实现中,Hugging Face 以 mistralai/Mistral-7B-Instruct-v0.1 为起点,因为它具备强大的指令遵循能力且缺乏固有的防护栏。他们使用 Anthropic 的 HH 偏好数据集进行红队提示,并将生成的 CAI 数据集与 Ultrachat 数据集合并,以保持整体的有用性。
有用性与“对齐税”
使用 MT Bench 进行评估表明,在 CAI 数据集上进行训练并不一定会降低模型的有用性。在某些情况下,加入 CAI 数据实际上提升了 MT Bench 分数。例如,加入 15% 的 cai-conversation-harmless 数据集(约 32k 条示例)后,SFT 模型的得分从约 6.25 提升至约 6.38。
安全性与鲁棒性
将 CAI 模型与基线 SFT+DPO 模型在 10 条红队提示和 “DAN”(Do Anything Now)越狱提示下进行比较,结果显示鲁棒性有显著提升:
| 方法 / 提示方式 | 无提示 | 安全系统提示 | DAN 提示 | 安全系统提示 + DAN 提示 |
|---|---|---|---|---|
| CAI (SFT + DPO) | 10/10 | 10/10 | 5/10 | 7/10 |
| CAI (SFT only) | 10/10 | 10/10 | 5/10 | 7/10 |
| Baseline (SFT + DPO) | 5/10 | 4/10 | 1/10 | 1/10 |
研究发现,仅使用安全系统提示对越狱几乎无效,而经过 CAI 训练的模型在提示注入方面显著更具韧性。
对齐风格的灵活性
由于 CAI 依赖于定义好的宪法,安全防护栏的“个性”可以自定义。Hugging Face 通过创建一个使用讽刺和幽默来拒绝有害请求的 “Grok 风格” 模型,展示了这一点,而不是使用标准的礼貌拒绝。
通过调整宪法,使其要求以讽刺的方式指出不敏感或以幽默的方式拒绝犯罪计划,他们生成了 grok-conversation-harmless 数据集。测试表明,Grok 风格的 CAI 模型(SFT+DPO)在多种提示方式下实现了 10/10 的安全成功率,包括在 DAN 提示下的 9/10,优于基线。
可用资源
- Tooling:
llm-swarmGitHub 仓库 - Datasets:
cai-conversation-harmless(基于 Anthropic)和grok-conversation-harmless(Grok 风格)。 - Models:
mistral-7b-anthropic(DPO)和mistral-7b-grok(SFT)。 - Recipe: alignment-handbook 中的宪法 AI 配方。
SUMMARY: Hugging Face 推出了一套端到端的配方和 llm-swarm 工具,以在开源模型上实现宪法 AI(CAI),实现基于用户自定义原则的可扩展自我对齐,无需昂贵的人类反馈。
TITLE: 使用开源大语言模型的宪法 AI
Sources
- OriginalConstitutional AI with Open LLMs