OpenAI 推理模型 CoT 可控性研究
OpenAI 发现,当前前沿推理模型在控制其思维链(CoT)方面表现不佳,这表明这些模型目前无法有意模糊其推理过程以规避安全监控。此类低可控性对 AI 安全是一个积极的结果,因为它暗示 CoT 监控仍然是识别不安全或不对齐行为的可靠方法。
理解 CoT 可控性
思维链(CoT)指的是 AI 代理为解决任务而生成的中间推理步骤。监控这些轨迹使安全系统能够评估代理的行为是否与用户目标保持一致。
CoT 可控性被定义为模型控制其 CoT 属性以降低可监控性的能力。由于衡量规避监控的真实动机十分困难,OpenAI 使用了一个代理指标:模型遵循关于其内部推理过程的特定指令的能力。这些指令包括以下要求:
- 在推理轨迹中仅使用小写字母。
- 避免使用特定与问题相关的关键词。
- 在 CoT 的每个句子末尾追加特定词语。
为评估此能力,OpenAI 引入了 CoT‑Control,一个开源评估套件,包含超过 13,000 条任务,来源于 GPQA、MMLU‑Pro、HLE、BFCL 和 SWE‑Bench Verified 等基准。
发现:前沿模型的可控性普遍低下
对 13 种推理模型的评估显示,所有测试的前沿模型在可靠控制其 CoT 方面均表现不佳。可控性得分——即模型成功遵守指令的推理轨迹比例——在 0.1% 到最高 15.4% 之间波动。
关于这些失败的关键观察包括:
- 认知意识 vs. 执行:模型常常在自己的 CoT 中意识到未遵循指令,但即便如此仍继续失败。
- 规模与性能:在开源权重模型中,可控性随模型规模略有提升,但在更大规模时效果趋于平缓。
- 计算与训练的影响:随着模型被要求进行更长时间的推理以及进行更多后训练,可控性会下降。例如,OLMo-3-7B-RL-Zero-Math 在强化学习训练期间的可控性得分下降了超过十倍。
- 对抗性条件:告知模型它们正被监控(“监控意识”)或正在评估(“评估意识”)会略微提升可控性,但提升幅度并不显著。自动化提示优化在训练集上带来收益,却未能迁移到新的指令类型上。
对 AI 安全与监控的意义
低 CoT 可控性被视为一种安全特性,而非缺陷。它确保 CoT 监控更为可信,因为模型难以轻易隐藏内部推理步骤来欺骗监控者。
然而,OpenAI 也指出,低可控性并不等同于高可监控性。通过其他机制(例如对思维链的直接优化压力),可监控性仍可能下降。
未来展望与监控
OpenAI 将把 CoT 可控性评估视为“金丝雀评估”——一种早期预警系统,用于检测模型在进化过程中是否获得塑造或隐藏其推理的能力。为保持透明,OpenAI 将在系统卡中开始报告 CoT 可控性与 CoT 可监控性,首批适用于未来的前沿模型 GPT-5.4 Thinking。