OpenAI 宣布使用人类反馈强化学习和 InstructGPT 的对齐策略

TL;DR

OpenAI 宣布,来自人类反馈的强化学习(RLHF)和 InstructGPT 系列是其对齐已部署语言模型的主要工具,能够在使用不到 GPT‑3 预训练算力的 2 % 的情况下实现强烈的人类偏好,但这些模型仍存在显著的不足,实验室计划使用更强大的模型来自动化对齐研究。

人类反馈强化学习作为核心对齐技术

OpenAI 表示,来自人类反馈的强化学习(RLHF)是当前用于对齐其已部署语言模型的主要技术。通过使用人类生成的偏好数据对 GPT‑3 等预训练模型进行微调,OpenAI 创建了一类称为 InstructGPT 的模型,这些模型被训练以遵循显式指令和诸如真实性、公平性和安全性等隐含意图。

InstructGPT 的效率与性能

  • Human Preference(人类偏好): InstructGPT 在用户中比一个规模大 100 倍的预训练模型更受青睐。
  • Compute Cost(计算成本): 对 InstructGPT 进行微调所消耗的 < 2 % 的算力 低于 GPT‑3 原始预训练所需的算力。
  • Human Feedback Effort(人类反馈投入): 微调过程大约涉及 20,000 小时的人类反馈
  • Customer Preference(客户偏好): 实际上,OpenAI 的 API 客户已经倾向于使用 InstructGPT 而非原始的预训练模型。

这些结果表明,使用相对适度的额外资源即可实现显著的对齐提升。

InstructGPT 的当前局限性

OpenAI 承认,当前版本的 InstructGPT 仍远未完全对齐。具体的失效模式包括:

  • 无法可靠地遵循简单指令。
  • 真实性不一致。
  • 未能拒绝有害请求。
  • 偶尔出现偏见或有害的输出。
  • 相较于基础预训练模型创造力下降,这一点在公开基准中未被捕捉。

实验室正积极研究 RLHF 的更深层科学理解以及提升人类反馈质量的方法。

对齐研究基础设施

OpenAI 的 自然语言 API 充当对齐实验的反馈回路,使模型接触到客户实际付费的多样化真实任务。该环境能够快速评估对齐技术的实际效果。

将对齐扩展至当前模型之外

  • Distinction from AGI Alignment(与 AGI 对齐的区别): 对 API 进行对齐比对人工通用智能(AGI)进行对齐更容易,因为这些任务可由人类监督,且模型并不比人类更聪明。
  • Role of RLHF(RLHF 的作用): 虽然单靠 RLHF 不太可能解决 AGI 对齐问题,但它被视为可扩展对齐方案的 核心构件
  • No Known Indefinitely Scalable Solution(暂无已知的无限可扩展解决方案): OpenAI 指出尚未发现永远可扩展的对齐方法,且随着 AI 能力的提升,预计会出现新的对齐挑战。

实用路线图:AI 辅助对齐研究

OpenAI 提出了 实用方法

  1. 构建能够比人类更快加速对齐研究的系统。
  2. 允许 AI 系统接管更多对齐任务,最终构思、实现并评估新的对齐技术。
  3. 将人类精力转向审查 AI 生成的对齐工作,而非亲自制作。
  4. 针对在相关领域具有人类水平能力的更窄范围 AI 系统,这些系统预计比通用或超人系统更易对齐。

为什么语言模型适合对齐自动化

  • 它们从互联网文本中包含了大量关于人类价值观的知识。
  • 它们不是独立的代理体,也不追求自主目标。
  • 对齐任务往往可以表述为自然语言或编码问题,符合模型的优势。

未来的对齐助手

OpenAI 提到即将推出的 WebGPT、InstructGPT 和 Codex 版本可能充当 对齐研究助理,尽管它们目前尚未具备足够的能力作出有意义的贡献。实验室计划 训练一个能够对对齐研究有用的模型,并在其能力足够时向外部对齐社区提供


本文忠实反映了 OpenAI 2022 年 8 月关于其对齐研究策略的公告,未在原文之外添加或推断任何内容。

Sources