Anthropic 研究:LLM 的道德能力自我修正
Anthropic 已经证明,通过人类反馈强化学习 (RLHF) 训练的大语言模型 (LLM) 具备“道德自我修正”的能力。这种能力允许模型在收到明确指令时避免产生有害输出,为训练遵循伦理原则的模型提供了一条路径。
22B 参数规模下的道德自我修正涌现
语言模型从 22B 参数规模开始表现出道德自我修正的能力。随着模型规模的增加以及 RLHF 训练的应用,这种能力通常会得到提升。
Anthropic 识别出这种涌现现象的两个主要驱动因素:
- 指令遵循 (Instruction Following):模型准确遵循复杂提示词的能力。
- 规范性概念学习 (Normative Concept Learning):学习复杂的规范性伤害概念的能力,例如偏见、歧视和刻板印象。
通过结合这两种能力,该规模的模型可以遵循指令以避免特定类型的道德有害输出。
道德自我修正的技术框架
道德自我修正被定义为模型在收到指令时避免产生有害输出的能力。研究通过三个不同的实验揭示了这种能力的各个方面。
研究结果表明,自我修正能力并非所有 LLM 的固有特征,而是以下因素的结果:
AI 安全与伦理的影响
这项研究的结果表明,对于训练语言模型遵循伦理原则的能力持谨慎乐观的态度。由于模型可以学习根据指令识别并避免伤害,因此通过指令微调和 RLHF 大规模实现安全护栏的技术上是可行的。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch