OpenAI 推出 ChatGPT

OpenAI 已推出 ChatGPT,这是一款设计用于对话形式交互的会话式 AI 模型。该形式使模型能够回答后续问题、承认错误、质疑不正确的前提,并拒绝不恰当的请求。

技术方法论:RLHF 与 GPT-3.5

ChatGPT 是 GPT-3.5 系列模型的微调版本,训练于 2022 年初。该模型使用 Azure AI 超算基础设施开发,并通过人类反馈强化学习(Reinforcement Learning from Human Feedback,RLHF)进行训练。

训练过程包括以下关键阶段:

  1. 监督微调:人类 AI 训练师提供对话,分别扮演用户和 AI 助手。这些训练师使用模型生成的建议来帮助撰写回复。随后将此对话数据集与 InstructGPT 数据集混合,后者已转换为对话格式。
  2. 奖励模型创建:为支持强化学习,OpenAI 收集比较数据,让 AI 训练师对一次对话中随机选取的消息的多个模型生成的完成度进行排序。
  3. 近端策略优化(PPO):利用奖励模型,对模型进行多轮 PPO 微调。

关键能力与对话格式

与之前的模型不同,ChatGPT 的对话格式实现了更自然、迭代的交互。例如,当出现代码错误时,模型可以请求更多上下文或根据用户后续的澄清提出潜在的修复方案。

此外,模型在处理不正确前提时表现出更强的能力。在与 InstructGPT 的对比中,询问“克里斯托弗·哥伦布在 2015 年抵达美国”时,InstructGPT 给出了事实错误的回答。而 ChatGPT 则识别出历史不准确性,挑战该前提,同时仍在假设情境下与提示进行交互。

已知局限性

OpenAI 识别出当前版本 ChatGPT 的若干关键局限:

  • 事实性:模型有时会产生“听起来合理但实际上错误或荒谬的答案”。这归因于 RL 训练期间缺乏真实来源、模型可能过于谨慎而拒绝正确答案,以及监督训练可能因人类示范者的知识而误导模型。
  • 敏感性:模型对输入措辞敏感,稍作改写可能导致不同的答案。
  • 冗长:由于训练数据的偏差(训练师倾向于更长、更完整的答案)以及过度优化,模型常常过于冗长并频繁使用特定短语。
  • 歧义处理:面对模糊查询时,模型往往直接猜测用户意图,而不是提出澄清性问题。
  • 安全性:尽管已努力拒绝不当请求,模型仍可能响应有害指令或表现出偏见行为。OpenAI 使用 Moderation API 来阻止或警告不安全内容,但仍会出现误报和漏报。

迭代部署与反馈

ChatGPT 作为研究预览发布,以收集用户反馈并了解模型的优势与不足。此发布遵循 OpenAI 的迭代部署策略,借鉴 GPT-3 与 Codex 的经验,通过 RLHF 减少有害和不真实的输出。

OpenAI 正积极征求对有问题输出的反馈,特别是现实世界中非对抗性环境下的有害输出,以及新出现的风险和可能的缓解措施。为鼓励反馈,他们推出了 ChatGPT 反馈大赛,为发现关键问题的用户提供 API 积分。

Sources