Anthropic 研究:LLM 的道德能力自我修正

Anthropic 已经证明,通过人类反馈强化学习 (RLHF) 训练的大语言模型 (LLM) 具备“道德自我修正”的能力。这种能力允许模型在收到明确指令时避免产生有害输出,为训练遵循伦理原则的模型提供了一条路径。

22B 参数规模下的道德自我修正涌现

语言模型从 22B 参数规模开始表现出道德自我修正的能力。随着模型规模的增加以及 RLHF 训练的应用,这种能力通常会得到提升。

Anthropic 识别出这种涌现现象的两个主要驱动因素:

  1. 指令遵循 (Instruction Following):模型准确遵循复杂提示词的能力。
  2. 规范性概念学习 (Normative Concept Learning):学习复杂的规范性伤害概念的能力,例如偏见、歧视和刻板印象。

通过结合这两种能力,该规模的模型可以遵循指令以避免特定类型的道德有害输出。

道德自我修正的技术框架

道德自我修正被定义为模型在收到指令时避免产生有害输出的能力。研究通过三个不同的实验揭示了这种能力的各个方面。

研究结果表明,自我修正能力并非所有 LLM 的固有特征,而是以下因素的结果:

AI 安全与伦理的影响

这项研究的结果表明,对于训练语言模型遵循伦理原则的能力持谨慎乐观的态度。由于模型可以学习根据指令识别并避免伤害,因此通过指令微调和 RLHF 大规模实现安全护栏的技术上是可行的。

Sources

相关