使用 GPT-4 查找 GPT-4 的错误

OpenAI 开发了 CriticGPT,这是一款基于 GPT-4 的专用模型,能够识别 ChatGPT 代码输出中的不准确之处。该工具旨在帮助人工 AI 训练师在强化学习人类反馈(RLHF)过程中发现细微错误,随着模型变得更为先进,这些错误对人类而言往往难以察觉。

通过 AI 辅助审查提升 RLHF

CriticGPT 解决了 RLHF 的一个根本性限制:随着 AI 模型变得更加博学且错误更加微妙,人工训练师对响应进行准确评分的难度日益增加。人类在提供高质量反馈方面的能力缺口可能会阻碍高级 AI 系统的对齐。

通过将 CriticGPT 融入标注流水线,OpenAI 为训练师提供了明确的 AI 帮助。在实验环境中,使用 CriticGPT 辅助的人工训练师的表现比未受助的训练师高出 60%。人类监督与 AI 批评的结合,使得反馈比仅有人类审查更为全面,并且比仅有模型审查包含更少的幻觉式错误。

训练方法与性能

CriticGPT 采用与 ChatGPT 类似的 RLHF 进行训练,但专注于错误检测。训练过程包括:

  • Manual Error Insertion: AI 训练师手动在 ChatGPT 生成的代码中插入错误。
  • Example Feedback: 训练师撰写示例批评,仿佛他们发现了插入的错误。
  • Comparative Rating: 训练师比较多个批评,以确定哪些成功捕获了插入的错误。

在涉及“自然出现”的 ChatGPT 错误的测试中,训练师在 63% 的情况下更倾向于 CriticGPT 的批评,而非标准的 ChatGPT 批评。这一偏好归因于 CriticGPT 产生的“挑剔”(无益的细枝末节抱怨)和幻觉更少。

为进一步提升质量,OpenAI 使用了针对批评奖励模型的额外测试时搜索。这使得可以配置精确率-召回率的权衡,在捕捉错误的积极性与幻觉风险之间取得平衡,从而为 RLHF 生成最有帮助的批评。

当前局限性

  • Input Length: 该模型在相对较短的 ChatGPT 回答上进行训练;监督未来的代理将需要处理长篇和复杂任务的方法。
  • CURLOPT Hallucinations: 模型仍会产生幻觉,这有时会导致人工训练师出现标注错误。
  • Error Distribution: 目前的重点是可以在单一位置识别的错误,而实际中的错误往往分散在响应的多个部分。
  • Complexity Ceiling: 对于极其复杂的任务,专家人类和 AI 助手都可能无法正确评估响应。

对 AI 对齐的未来影响

OpenAI 计划在其 RLHF 流程中扩大类似 CriticGPT 模型的使用。研究表明,将 RLHF 应用于 GPT-4 能帮助人类为 GPT-4 生成更高质量的 RLHF 数据,形成一种改进循环,这对于对齐日益复杂的 AI 系统至关重要。

Sources