OpenAI InstructGPT:使语言模型符合指令要求

OpenAI 开发了 InstructGPT,这是一组旨在比 GPT-3 更紧密地符合用户意图的语言模型。通过利用人类反馈强化学习 (RLHF),InstructGPT 提高了指令遵循能力,增加了真实性,并减少了有害内容的生成。

改进的指令遵循与安全性

InstructGPT 在遵循英语指令并提供有用的输出方面显著优于 GPT-3。虽然 GPT-3 是通过在大规模互联网文本数据集上预测下一个词进行训练的——这往往导致输出不真实或有害——但 InstructGPT 经过专门对齐,以执行用户真正想要执行的任务。

关键性能改进包括:

  • 更高的用户偏好: 人类标注员显著更倾向于 InstructGPT 的输出而非 GPT-3,即使在为 GPT-3 提供 few-shot prompts 以进入“指令遵循模式”的情况下也是如此。
  • 规模效率: 标注员更倾向于 1.3B 参数的 InstructGPT 模型,而非 175B 参数的 GPT-3 模型,尽管前者的参数量减少了 100 倍以上。
  • 减少毒性和虚假信息: 根据 RealToxicityPrompts 和 TruthfulQA 基准测试,InstructGPT 产生的模仿性虚假信息较少,且毒性低于 GPT-3。
  • 更低的幻觉率: 对 API prompt 分布的人类评估显示,InstructGPT 编造事实的频率较低,并能生成更合适的响应。

RLHF 训练方法论

InstructGPT 使用三步人类反馈强化学习 (RLHF) 过程进行训练,以“解锁”预训练 GPT-3 模型中已有的能力:

  1. 监督微调: 标注员针对提交给 API 的 prompts 提供所需模型行为的演示。
  2. 奖励模型训练: 标注员对多个模型输出进行排序,并训练一个奖励模型 (RM) 来预测人类会更倾向于哪种输出。
  3. PPO 微调: 使用 PPO 算法对 GPT-3 策略进行微调,以最大化 RM 提供的奖励信号。

为了防止“对齐税 (alignment tax)”——即模型在与客户偏好对齐时,在学术 NLP 任务上的性能下降——OpenAI 在 RL 微调过程中使用正常的对数似然最大化,将一小部分原始 GPT-3 预训练数据混合其中。这种方法在保持安全性并实现偏好对齐的同时,保留甚至提高了在学术基准测试上的性能。

泛化能力与偏好对齐

OpenAI 测试了 InstructGPT 是否会过拟合于训练标注员的特定偏好。实验表明,未参与训练的标注员(那些没有产生训练数据的人)对 InstructGPT 输出的偏好率与训练标注员相同。此外,在标注员子集上训练的奖励模型可以很好地泛化到其他子集,这表明模型符合更广泛的偏好,而不仅仅是特定的一组标注员。

当前的局限性与安全风险

尽管取得了这些进展,InstructGPT 尚未完全对齐或实现安全。OpenAI 识别出了一些持续存在的挑战:

  • 残余风险: 模型在没有明确提示的情况下,仍会生成偏见、有害或涉及性与暴力的内容。
  • 易受滥用: 由于模型更擅长遵循指令,如果被明确指示这样做,它们可能更容易产生不安全的输出。如何可靠地拒绝有害指令仍然是一个开放的研究问题。
  • 文化偏见: 由于模型是基于英语指令训练的,它倾向于英语母语人口的文化价值观。

为了减轻这些风险,OpenAI 继续审查潜在的应用场景,提供内容过滤器以检测不安全的生成内容,并监控滥用行为。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch