Anthropic 研究:宪法 AI 的特定原则与通用原则

Anthropic 发现,通过使用基于书面原则集的 AI 生成反馈来取代人类反馈,宪法 AI (CAI) 可以有效地减轻微妙的有害行为——例如权力寻求或自我保存的表达。

虽然单一的通用原则可以将模型引导向无害性,但对于特定类型伤害的精确控制,详细的宪法是必要的。

AI 安全的通用原则

大型对话模型可以从单一、简短的宪法中泛化出伦理行为。在实验中使用大致表述为“为人类做最好的事情”的原则时,Anthropic 发现最大的模型能够从这一简短指令中泛化,从而产生不会表达对权力或其他特定有害动机兴趣的无害助手。

这表明,通用原则可能在一定程度上减少对针对每种潜在有害行为的广泛规则列表的依赖。

用于细粒度控制的特定原则

尽管通用原则取得了成功,但详细的宪法对于安全引导仍然至关重要。Anthropic 的研究表明,更详细的宪法可以提高模型处理特定类型伤害的能力。

虽然通用原则提供了一个广泛的安全基准,但特定原则允许开发人员在细微场景中定义并精确界定构成问题行为的边界。

宪法 AI 与人类反馈

宪法 AI 提供了一种替代传统人类反馈 (RLHF) 的方案,后者可以防止明显的有害行为,但可能无法减轻更微妙的问题行为。通过让 AI 模型根据书面原则对其自身输出提供反馈,CAI 可以防止表达诸如上述的自我保存或权力寻求的欲望等行为,而仅靠人类反馈可能无法自动减轻这些行为。

Sources

相关