Anthropic: 使用 RLHF 训练一个乐于助人且无害的助手

Anthropic 开发了一种方法,通过使用偏好建模和来自人类反馈的强化学习 (RLHF) 将语言模型微调为乐于助人且无害的助手。这种对齐过程增强了几乎所有 NLP 评估中的性能,并且仍然与摘要生成和 Python 编程等专门任务的训练保持兼容。

RLHF 用于模型对齐与性能

来自人类反馈的强化学习 (RLHF) 用于将语言模型与人类偏好对齐,特别侧重于“乐于助人”和“无害”这两个目标。这种对齐训练并不会为了安全性而牺牲通用能力;相反,它提高了几乎所有 NLP 评估的性能。此外,RLHF 与获取专门技能(如 Python 编程和摘要生成)完全兼容,这表明对齐可以与高水平的技术熟练度并存。

迭代式在线训练方法论

为了高效地改进数据集和模型,Anthropic 采用了迭代式在线训练模式。在这种方法中,偏好模型和 RL 策略会以每周一次的频率使用新鲜的人类反馈数据进行更新。这种迭代循环允许模型根据当前性能和新的人类输入进行演进,从而创建一个持续的改进闭环。

鲁棒性与 RL 奖励分析

对 RLHF 训练鲁棒性的研究揭示了奖励与策略偏离其起始点之间的特定数学关系。具体而言,RL 奖励与策略及其初始化之间的 KL 散度平方根之间存在大致的线性关系。

其他技术分析

除了主要的 RLHF 结果外,研究还包括了几项外围分析,以确保模型的稳定性和可靠性:

  • Calibration and Objectives: 调查模型置信度如何与准确性对齐,以及如何平衡相互竞争的目标(例如,乐于助人 vs. 无害)。
  • OOD Detection: 使用分布外 (OOD) 检测来识别模型无法处理的提示词。
  • Human Comparison: 将模型输出与人类作者生成的输出进行对比,以基准测试质量和语气。
  • Prompt Testing: 使用源自近期相关研究的提示词对模型进行评估,以测试一致性和安全性。

Sources

相关