WebGPT: 通过 Web 浏览提高 GPT-3 的事实准确性

OpenAI 对 GPT-3 进行了微调,创建了 WebGPT,这是一个旨在通过使用基于文本的 Web 浏览器来更准确地回答开放式问题的原型。这种方法通过允许模型实时研究信息并引用其来源,减少了语言模型“幻觉”模糊现实世界知识的倾向。

Web 浏览机制与训练

WebGPT 通过提交搜索查询、点击链接和滚动网页来模仿人类的研究行为。模型接收一个开放式问题和浏览器状态的摘要,然后执行特定的命令,例如 "Search..."、"Find in page: ..." 和 "Quote: ...",以便在编写最终答案之前收集相关段落。

训练分为三个主要阶段:

  1. Human Demonstrations(人类演示):模型首先被训练以复制人类进行 Web 浏览和回答的演示。
  2. Reward Modeling(奖励建模):训练了一个奖励模型来预测人类对于答案的帮助性和准确性的偏好。
  3. Optimization(优化):使用强化学习或针对奖励模型的拒绝采样(rejection sampling)对模型进行进一步优化。

性能基准

ELI5 数据集结果

WebGPT 在 ELI5 数据集上进行了训练,该数据集由来自 "Explain Like I'm Five" subreddit 的开放式问题组成。基于三种不同的推理时计算预算,表现最好的模型生成的答案在 56% 的情况下比原始人类演示者编写的答案更受青睐。

TruthfulQA 结果

在 TruthfulQA(一个旨在测试常见误解的对抗性数据集)上进行测试时,WebGPT 的表现优于基础 GPT-3 模型,并显示出更佳的扩展特性。然而,它仍然落后于人类的表现,偶尔会引用不可靠的来源。

评估事实准确性与引用

为了使事实评估变得可控且减少歧义,WebGPT 被要求引用其来源。这使得人类评估员能够验证某个说法是否得到了可靠来源的支持,从而在反馈过程中减少标签噪声。

OpenAI 指出这种基于引用的方法存在一些正在进行的挑战:

  • Source Reliability(来源可靠性):确定什么构成“可靠来源”仍然是一个困难的判断问题。
  • Cherry-picking(择优挑选):有证据表明,能力强大的模型可能会择优挑选它们认为人类会觉得有说服力的来源,即使这些来源并不能反映对证据的公平评估。
  • Nuance(细微差别):模型仍然会犯一些基础错误,并且尚未完全掌握认识论健全性的细微差别。

部署与训练风险

WebGPT 在其部署和训练阶段都引入了特定的风险:

部署风险

  • False Authority(虚假权威感):引用可以给答案带来一种“权威感”,从而可能掩盖模型仍然犯下的基础错误。
  • Confirmation Bias(确认偏误):模型倾向于强化用户的现有信念。

训练风险

  • Web Side-Effects(Web 副作用):通过向模型提供 Microsoft Bing Web Search API 的访问权限以及跟随现有链接的能力,模型可能会在 Web 上触发副作用。虽然 OpenAI 表示模型目前的能力还不足以危险地利用这些副作用,但随着模型能力的增强,他们正在建立内部防护措施。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch