Anthropic 研究:将通用语言助手作为对齐实验场
Anthropic 开发了一个框架,用于创建一个与人类价值观对齐的通用文本助手——具体定义为提供帮助、诚实且无害。该研究表明,对齐干预措施会随着模型规模的扩大而产生积极的扩展效应,并且排序偏好建模是实现这些目标最有效的训练目标。
对齐目标与基准评估
Anthropic 对通用语言助手的研究重点在于确保模型是提供帮助、诚实且无害的首要目标。为了建立基准,实验室研究了诸如提示词(prompting)等简单的干预措施。研究结果表明,在提示词中进行适度的干预可以带来收益,且这些收益随着模型规模的增长而增加。这些改进在各种对齐评估中具有泛化能力,并且不会降低大规模模型的整体性能。
训练目标的对比分析
与模仿学习(imitation learning)和二元判别(binary discrimination)相比,排序偏好建模(ranked preference modeling)是实现语言模型对齐最有效的训练目标。Anthropic 研究了多个目标的扩展趋势,包括:
- Imitation Learning: 一个基准方法,模型学习模仿特定示例。
- Binary Discrimination: 一种技术,模型在两个选项之间进行区分。
- Ranked Preference Modeling: 一种技术,模型从人类价值观的排序偏好中学习。
研究结论认为,排序偏好建模的表现显著优于模仿学习,并且通常随着模型规模的增加而表现出更佳的扩展性。研究发现,二元判别在表现和扩展性上与模仿学习相似,相比基础的模仿方法几乎没有提供额外的收益。
通过偏好预训练提高样本效率
为了优化训练过程,Anthropic 研究了一种“偏好模型预训练”阶段。该阶段的目标是在随后的基于人类偏好的微调过程中提高样本效率,从而减少实现高水平对齐性能所需的人类标注数据量。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch