OpenAI 评估链式思考可监控性
OpenAI 引入了一个系统框架来评估“可监控性”,其定义为监控器预测关于代理行为的感兴趣属性(例如欺骗、奖励黑客或偏见推理)的能力。核心发现是,监控模型的内部链式思考(CoT)比仅监控其最终行动和输出要显著更有效,尤其是在模型规模扩大且“思考”时间更长时。
可监控性框架
为了具体衡量模型推理的透明度,OpenAI 开发了一套包含 13 项评估、覆盖 24 个环境的评估体系。这些评估被划分为三种原型:
- 干预评估:这些评估在环境中引入受控变化,以观察监控器是否能够通过识别 CoT 中的证据来检测行为变化的原因。
- 过程评估:这些评估聚焦于解答路径有限的任务(例如数学题),以确定监控器是否能够识别模型实际采取的具体步骤。
- 结果属性评估:这些评估测试监控器是否能够基于模型的推理预测输出的可测量属性——例如在编码任务中的奖励黑客行为。
这些评估覆盖了一系列行为,包括中性任务、阿谀奉承、偏见以及一般性错位(作弊或撒谎)。
关于模型规模和强化学习的关键发现
OpenAI 对可监控性随模型规模和训练演变的研究揭示了若干关键趋势:
强化学习(RL)的影响
与担心强化学习可能激励模型隐藏推理或漂移至不可监控状态的观点相反,OpenAI 发现,在当前前沿规模下的 RL 优化并未实质性降低可监控性。某些情况下,它实际上提升了推理过程初始步骤的可监控性。
“可监控性税”
已有文献记录了模型规模与推理努力之间的权衡。OpenAI 观察到,运行更高推理努力的小模型可以实现与运行较低推理努力的大模型相当的能力,但小模型更易于监控。这种权衡——即以略微降低能力为代价换取显著提升的可监控性——被称为“可监控性税”。
推理努力与性能
随着模型生成更长的链式思考,可监控性通常会提升。此外,研究表明,使用更强大的模型作为监控器,并提升这些监控器的推理努力,可更准确地预测代理的行为。
通过后续提问提升可监控性
OpenAI 发现,通过对被监控属性提出后续问题(例如“你有没有做过可疑的事?”)可以事后提升可监控性。
初步结果表明,这些后续提问提升了可监控性,尤其在初始推理努力较低时更为明显。关键在于,提升来源于后续提问产生的链式思考,而非向用户提供的最终答案,这暗示模型在内部推理上可能比直接回应更为坦率。
对可扩展控制的影响
随着 AI 系统超越人类水平的表现,直接的人类监督变得不切实际。OpenAI 设想,CoT 监控可以在可扩展的控制方案中充当“承载控制层”,即由可信但较弱的监控器来监管更强大的代理。
该方法被视为对机制可解释性的补充。通过将 CoT 监控与其他可解释性方法相结合,OpenAI 旨在构建一种“纵深防御策略”,以确保高度能力模型的安全部署。