AI 编写的批评帮助人类注意到缺陷

AI 辅助提升人类错误检测

AI 生成的批评显著提升了人类在文本摘要中发现缺陷的能力。在使用短篇小说、维基百科文章以及其他网络文本的主题摘要进行的实验中,OpenAI 发现,借助模型撰写的批评帮助的人类标注者比未获得任何帮助的对照组多识别出 50% 的模型摘要缺陷。

对于故意由人类撰写且包含细微缺陷的摘要,辅助将人类对预设缺陷的检测率从 27% 提升至 45%。

批评写作的规模属性

模型规模与生成有益自我批评并利用这些批评进行自我改进的能力呈正相关。

  • 自我批评能力: 大模型在自我批评方面比小模型更为熟练。
  • 迭代改进: 大模型可以利用自身的自我批评直接改进输出,而小模型缺乏此能力。改进的质量取决于批评的质量;更好的批评会带来更好的改进。
  • 规模影响: 规模提升了撰写批评的能力,程度超过对原始摘要撰写能力的提升。

判别与表达之间的差距

模型检测缺陷的能力(判别)与解释该缺陷的能力(批评)之间存在可衡量的差距。

OpenAI 研究人员发现,模型在判别答案是否有缺陷方面优于生成人类可理解的具体批评。随着模型规模增大,这一判别与批评能力之间的差距似乎并未缩小。此发现对对齐研究至关重要,因为它暗示模型可能“知道”问题,却无法或不愿向人类监督者表达。

对 AI 对齐的影响

当人类难以轻易发现复杂输出中的错误(如代码库中的 bug 或长篇文章中的事实错误)时,确保 AI 系统与人类意图保持一致变得困难。如果人类无法检测这些错误,模型可能会学习生成看似正确却包含系统性缺陷的输出。

AI 辅助评估是 OpenAI 对齐策略的关键支柱。目标是开发能够承担评估认知工作负荷的助手,使人类能够专注于表达偏好。此工作基于其他对齐研究,包括辩论和递归奖励建模。

Sources