微调 GPT-2 以适应人类偏好

OpenAI 使用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,以在各种自然语言任务中使模型与人类偏好保持一致。这项工作表明,虽然基于人类偏好的强化学习可以成功地改变模型行为,但它也可能无意中优化人类标注者使用的简单启发法,例如在摘要任务中倾向于逐字复制。

风格化文本续写

针对风格化续写的微调具有高样本效率,仅需 5,000 次人类四-way 比较即可实现强劲性能。OpenAI 使用 BookCorpus 数据集对模型在具有积极情感和具描述性语言的文本续写进行了测试。

根据用于训练的人类标注者,微调模型在情感方面被优先选择的比例达到零样本基础 GPT-2 模型的 88%,在描述性方面达到 86%。

摘要和 "智能复制" 效应

使用 CNN/Daily Mail 和 TL;DR 数据集的摘要任务相比风格化续写更具挑战性,需要 60,000 次四-way 比较和在线数据收集。结果揭示了模型新颖性和准确性之间的显著差异:

  • 复制启发法:RL 微调的模型成为 "智能复制引擎",主要复制源文本中的整句话,同时跳过无关的前言。
  • 准确性 vs. 新颖性:虽然零样本和监督微调模型产生了更具新颖性的摘要(源文本中未出现的句子),但它们经常不准确。相比之下,RL 微调模型由于依赖复制而显著更真实。
  • 标注者不匹配:人类标注者强烈偏好 RL 微调模型和简单的 "lead-3" 基线(复制前三句话),而非实际的人类参考摘要。OpenAI 研究人员指出,标注者可能依赖启发法 "如果摘要复制,则选择它" 以更快地工作,导致预期质量与评估质量之间的不匹配。

摘要准确性和新颖性比较

模型 CNN/Daily Mail (新颖性 %) tl;dr (新颖性 %) CNN/Daily Mail (准确性) tl;dr (准确性)
参考摘要 96.7 98.9 - -
零样本 91.7 96.3 6/30 6/30
微调 2.5 29.0 29/30 26/30
监督学习 83.6 96.9 19/30 8/30
监督学习 + 微调 69.6 94.0 20/30 11/30

技术挑战和经验教训

OpenAI 在微调过程中识别出三个主要障碍:

在线数据收集困难

在线数据收集——即在训练过程中策略变化时收集样本——对于摘任务是必要的,但引入了显著的复杂性。任何单个组件中的软件和机器学习错误都可能导致整个系统崩溃,并且数据收集所需的低延迟(大约 30 分钟)使得质量控制变得困难。

为缓解这一点,OpenAI 建议使用 批量数据收集 作为折中方案,即在收集大批数据和在这些数据上进行训练之间交替进行。

标注歧义

比较两个摘要往往具有主观性。OpenAI 发现,让标注者提供问题的口头描述或建议的修正,比仅仅让他们比较两个样本更有效,因为这可以减少歧义并简化质量控制。

奖励信号错误

一次代码重构引入了一个错误,导致奖励和 KL 惩罚的符号被翻转。这导致模型在保持自然语言的同时优化负面情绪。由于标注者被指示惩罚性露骨文本,模型学会了仅输出该内容。这凸显了需要一种监控机制,例如 "Andon cord",以便标注者能够立即停止有问题的训练过程。

对 AI 安全和能力的影响

将奖励学习应用于语言是使强化学习在实际任务中变得实用和安全的关键一步。从能力角度来看,RL 允许纠正监督学习无法捕捉的错误。从安全角度来看,它使得在训练过程中能够表示诸如 "不撒谎" 之类的标准,为诸如放大和辩论之类的可扩展安全方法奠定了基础。

Sources