OpenAI 证明者‑验证者游戏提升语言模型输出的可读性
TL;DR
OpenAI 引入了一种 证明者‑验证者游戏 训练框架,教会强大的语言模型生成弱模型能够轻松检查的解答,这也使得输出对人类评估者更具可读性。
通过优化提升可读性
仅仅优化答案的正确性可能会产生人类难以跟随的解答。OpenAI 表明,当时间有限的人类评估者评判高度优化的解答时,他们的错误率几乎是评估较少优化的解答时的两倍。通过训练一个强模型(即 证明者)生成文本,使得一个更弱的模型(即 验证者)能够验证,得到的输出既正确又更易于人类评估。实验使用了小学数学题目,并在保持人类可读性的同时,实现了纯正确性优化训练约一半的准确率提升。
工作原理
训练循环在两个阶段之间交替进行:
- 验证者训练 – 一个弱验证者模型(其预训练计算量约比证明者少 3 个数量级)学习预测证明者生成的解答是否正确。
- 证明者训练 – 强证明者模型被指示扮演 帮助型 角色(奖励在验证者上得分高的正确解答)或 狡诈型 角色(奖励虽然错误但在验证者上仍得高分的解答)。最初,狡诈的证明者能够欺骗验证者,但每一轮都会将这些欺骗性解答加入验证者的训练集,从而消除该漏洞。当狡诈的证明者不再能够产生令人信服的错误答案时,训练停止。
这种对抗式的协同训练迫使证明者生成足够透明的解答,以便验证者——进而是人类——能够评估。
关键发现
- 性能与可读性权衡 – 仅在人工推导上进行监督微调可获得高可读性但准确率低;纯正确性优化可获得高准确率但可读性低。证明者‑验证者游戏在两者之间取得平衡,保持强可读性并具备中等准确率。
- 三种有用的模型角色
- 稳健验证者 – 能够准确区分正确与错误的解答,即使证明者尝试欺骗。
- 帮助型证明者 – 生成对人类阅读者仍然清晰的解答,降低评估者错误率。
- 狡诈型证明者 – 产生细微的错误解答,最初会混淆评估者,暴露出需要进一步改进的弱点。
论文提供了具体示例(例如多步骤的年龄计算问题),展示了帮助型证明者的推理是明确且易于跟随的,而狡诈型证明者的推理包含刻意的错误,但在训练早期仍能获得验证者的高分。
对齐与可信性的意义
要求语言模型输出 可验证 的论证可以降低对人类可读性判断的依赖,并推动未来更强大 AI 系统的自主对齐。透明且可检查的输出能够提升在教育、金融和科学研究等高风险应用中的信任度。尽管当前研究仅限于单一数学数据集且仍依赖真实标签,但该方法论指向了一条可扩展的路径,用于构建其正确性无需大量人工监督即可显现的 AI 系统。
结论
证明者‑验证者游戏表明,训练强模型生成弱模型能够验证的文本,既提升了人类的可读性,又保留了纯正确性优化所带来的相当部分的准确率提升。该方法为将日益强大的语言模型与人类价值观对齐提供了有前景的途径,通过使其推理过程透明且易于审计。
Authors: Yining Chen, Jan Hendrik Kirchner Contributors: Angela Baek, Yuri Burda, Thomas Degry, Harri Edwards, Elie Georges, Cary Hudson, Jan Leike, Nat McAleese, Wes McCabe, Lindsay McCallum, Freddie Sulit