Constitutional AI: Harmlessness from AI Feedback
Anthropic 开发了 Constitutional AI,这是一个用于训练 AI 助手无害化的框架,而无需依赖对有害输出进行大量的人工标注。通过使用一组预定义的规则或原则——即“宪法”(constitution)——系统通过监督学习和来自 AI 反馈的强化学习(RLAIF)这两个阶段的过程来改进其自身行为。
The Constitutional AI Process
Constitutional AI 用基于原则集的 AI 驱动评估取代了人工引导的奖励建模。训练过程分为两个主要阶段:
Supervised Learning (SL) Phase
在监督阶段,模型会对提示词生成初始响应。然后,它会根据以下工作流程生成对这些响应的自我批评和修订:
- Sampling: 初始模型采样一个响应。
- Critique: 模型根据宪法对其自身的响应生成批评意见。
- Revision: 模型修订响应,使其更符合原则。
- Finetuning: 在这些由 AI 生成的修订响应上对原始模型进行微调。
Reinforcement Learning (RL) Phase
在监督阶段之后,模型会进行来自 AI 反馈的强化学习(RLAIF)。在这一 RL 阶段,系统使用一个模型来根据宪法评估两个采样的响应中哪一个更好。这会创建一个 AI 偏好数据集,用于训练一个偏好模型。该偏好模型随后作为最终 RL 训练步骤的奖励信号。
Key Capabilities and Outcomes
Constitutional AI 能够创建一个既无害又不会回避问题的 AI 助手。与那些可能只是简单拒绝回答有害查询的模型不同,Constitutional AI 助手通过解释其反对理由来参与有害查询,从而为其决策过程提供透明度。
为了提高性能和透明度,监督学习和 RL 阶段都利用了思维链(chain-of-thought)风格的推理。这使得模型能够阐述其批评和修订背后的推理过程,从而使 AI 的决策过程对人类来说更具可解释性。
Implications for AI Safety and Control
Constitutional AI 表明,通过显著减少人工标注,可以更精确地控制 AI 行为。通过将监督重点从标注单个输出转向定义高层规则(即宪法),研究人员可以随着 AI 系统能力的增强而扩展 AI 系统的安全训练,利用 AI 自身的能力来监督其他 AI。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch