OpenAI InstructGPT:使语言模型符合指令要求
OpenAI 开发了 InstructGPT,这是一组旨在比 GPT-3 更紧密地符合用户意图的语言模型。通过利用人类反馈强化学习 (RLHF),InstructGPT 提高了指令遵循能力,增加了真实性,并减少了有害内容的生成。
改进的指令遵循与安全性
InstructGPT 在遵循英语指令并提供有用的输出方面显著优于 GPT-3。虽然 GPT-3 是通过在大规模互联网文本数据集上预测下一个词进行训练的——这往往导致输出不真实或有害——但 InstructGPT 经过专门对齐,以执行用户真正想要执行的任务。
关键性能改进包括:
- 更高的用户偏好: 人类标注员显著更倾向于 InstructGPT 的输出而非 GPT-3,即使在为 GPT-3 提供 few-shot prompts 以进入“指令遵循模式”的情况下也是如此。
- 规模效率: 标注员更倾向于 1.3B 参数的 InstructGPT 模型,而非 175B 参数的 GPT-3 模型,尽管前者的参数量减少了 100 倍以上。
- 减少毒性和虚假信息: 根据 RealToxicityPrompts 和 TruthfulQA 基准测试,InstructGPT 产生的模仿性虚假信息较少,且毒性低于 GPT-3。
- 更低的幻觉率: 对 API prompt 分布的人类评估显示,InstructGPT 编造事实的频率较低,并能生成更合适的响应。
RLHF 训练方法论
InstructGPT 使用三步人类反馈强化学习 (RLHF) 过程进行训练,以“解锁”预训练 GPT-3 模型中已有的能力:
- 监督微调: 标注员针对提交给 API 的 prompts 提供所需模型行为的演示。
- 奖励模型训练: 标注员对多个模型输出进行排序,并训练一个奖励模型 (RM) 来预测人类会更倾向于哪种输出。
- PPO 微调: 使用 PPO 算法对 GPT-3 策略进行微调,以最大化 RM 提供的奖励信号。
为了防止“对齐税 (alignment tax)”——即模型在与客户偏好对齐时,在学术 NLP 任务上的性能下降——OpenAI 在 RL 微调过程中使用正常的对数似然最大化,将一小部分原始 GPT-3 预训练数据混合其中。这种方法在保持安全性并实现偏好对齐的同时,保留甚至提高了在学术基准测试上的性能。
泛化能力与偏好对齐
OpenAI 测试了 InstructGPT 是否会过拟合于训练标注员的特定偏好。实验表明,未参与训练的标注员(那些没有产生训练数据的人)对 InstructGPT 输出的偏好率与训练标注员相同。此外,在标注员子集上训练的奖励模型可以很好地泛化到其他子集,这表明模型符合更广泛的偏好,而不仅仅是特定的一组标注员。
当前的局限性与安全风险
尽管取得了这些进展,InstructGPT 尚未完全对齐或实现安全。OpenAI 识别出了一些持续存在的挑战:
- 残余风险: 模型在没有明确提示的情况下,仍会生成偏见、有害或涉及性与暴力的内容。
- 易受滥用: 由于模型更擅长遵循指令,如果被明确指示这样做,它们可能更容易产生不安全的输出。如何可靠地拒绝有害指令仍然是一个开放的研究问题。
- 文化偏见: 由于模型是基于英语指令训练的,它倾向于英语母语人口的文化价值观。
为了减轻这些风险,OpenAI 继续审查潜在的应用场景,提供内容过滤器以检测不安全的生成内容,并监控滥用行为。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch