从人类反馈中学习摘要生成
OpenAI 已将基于人类反馈的强化学习(RLHF)应用于训练语言模型以进行文本摘要,发现这种方法相比标准监督学习显著提高了摘要质量。研究人员表明,经过人类反馈训练的 13 亿参数模型可以超越仅通过监督学习训练的 120 亿参数模型。
基于人类反馈的强化学习在摘要任务中优于模型规模扩展
基于人类反馈的强化学习相比仅增加模型规模或依赖监督微调,提供了一条获得高质量摘要的更有效途径。在比较评估中,人类标注者更倾向于选择来自 1.3B 和 6.7B 人类反馈模型的摘要,而非 Reddit 数据集中原始的人工撰写的 “TL;DR” 摘要。
虽然标注者倾向于更长的摘要——这导致模型趋向于最大允许长度——但在控制长度后,对 6.7B 模型摘要的偏好仅略有下降(从 70% 降至 65%),这表明质量提升主要并非由摘要长度驱动。
在新闻数据集上的泛化与迁移
在 Reddit TL;DR 数据集上训练的模型能够有效迁移到其他领域,无需额外的微调。当应用于 CNN/DailyMail 新闻数据集——该数据集包含的文章长度是 Reddit 帖子的两倍以上,且写作风格不同——基于人类反馈的模型生成了高质量的短摘要。
在控制长度的情况下,6.7B 基于人类反馈的模型生成的摘要在 CNN/DM 数据集中获得的评分高于人工撰写的参考摘要。这表明 RLHF 过程帮助模型学习了摘要的一般原则,而不仅仅是模仿训练数据的特定风格。
基于人类反馈的强化学习的技术方法
训练过程包括四个主要阶段:
- 初始模型训练:首先通过监督学习对 GPT 风格的 transformer 模型(1.3B 和 6.7B 参数)进行微调,以预测人类撰写的 TL;DR。
- 人类比较数据收集:人类比较同一帖子的两个不同摘要并选择更偏好的版本。主要模型是在大约 65,000 次比较上进行训练的,尽管只要有 8,000 次比较也能看到有效结果。
- 奖励模型训练:训练一个奖励模型来预测人类偏好,将(帖子,摘要)对映射到奖励值。
- RL 微调:使用近端策略优化(PPO)在 100 万个回合上将摘要策略与奖励模型进行对抗优化。使用 KL 惩罚以确保策略保持在初始监督模型附近。
数据质量与奖励优化
为避免模型从低质量标签中学习平均行为的问题,OpenAI 实施了严格的数据质量控制:
- 承包商管理:OpenAI 没有使用众包,而是雇佣了大约 80 名承包商,按小时支付工资,以确保亲密的工作关系,包括入职培训以及通过聊天和视频通话进行直接沟通。
- 一致性监控:研究人员密切监控他们自己的判断与标注者判断之间的一致率。
- 优化强度:团队发现,过度优化奖励模型最终会导致性能下降。最佳样本的预测奖励大约等于数据集中参考摘要的第 99 百分位数。
局限性与计算需求
尽管取得了性能提升,研究人员仍指出了一些关键局限性:
- 行为定义:RLHF 优化的是一个已定义的行为,但并不决定该行为 应该 是什么。对于复杂任务,研究人员建议在定义“好”行为时纳入受影响的群体。
- 数据集偏差:由于 Reddit TL;DR 数据集包含经过最小审核的内容,模型可能生成具有冒犯性或反映有害社会偏见的摘要。
- 计算成本:扩展奖励模型和策略需要大量资源;微调 6.7B 模型大约需要 320 GPU 天。
- 性能差距:模型尚未达到绝对的人类水平表现。在准确性、覆盖率和连贠性的 7 分制评分中,模型只有 45% 的时间获得满分总分,而参考摘要只有 23%。
未来方向
OpenAI 旨在将人类反馈扩展到人类评估困难的任务,例如需要大量研究来验证的问题。提出的解决方案包括开发 ML 驱动的工具,帮助人类更准确地评估输出。此外,实验室还在探索超越二元比较的反馈类型,如人类演示、直接编辑模型输出以及对偏好的详细解释。