OpenAI 推理模型 CoT 可控性研究
OpenAI 發現,目前的前沿推理模型在控制其思考鏈(CoT)方面掙扎,這表明這些模型目前無法刻意隱蔽其推理以逃避安全監控。這種低可控性對 AI 安全而言是一個正面結果,因為它暗示 CoT 監控仍然是識別不安全或不對齊行為的可靠方法。
了解 CoT 可控性
思考鏈(CoT)指的是 AI 代理為解決任務而產生的中間推理步驟。監控這些痕跡使安全系統能評估代理的行為是否與使用者目標對齊。
CoT 可控性被定義為模型控制其 CoT 性質以降低可監控性的能力。由於衡量逃避監控的現實激勵困難,OpenAI 使用了一個代理指標:模型遵循關於其內部推理過程的特定指示的能力。這些指示包括以下要求:
- 在推理痕跡中僅使用小寫字母。
- 避免使用特定與問題相關的關鍵字。
- 在 CoT 的每個句子末尾添加特定詞彙。
為了評估此項,OpenAI 推出了 CoT-Control,一個開源評估套件,包含超過 13,000 個任務,來源於包括 GPQA、MMLU‑Pro、HLE、BFCL 與 SWE‑Bench Verified 在內的基準。
發現:前沿模型的可控性普遍低下
對 13 種推理模型的評估顯示,所有受測的前沿模型在可靠控制其 CoT 方面都存在困難。可控性分數——以模型成功遵守指示的推理痕跡比例衡量——介於 0.1% 到最高 15.4% 之間。
關於這些失敗的主要觀察包括:
- 認知意識 vs. 執行: 模型常在其自身的 CoT 中意識到未遵守 CoT 指示,但即使如此仍持續失敗。
- 規模與效能: 雖然在開放權重模型中,可控性隨模型大小略有提升,但在更大規模時此效應逐漸減弱。
- 計算與訓練的影響: 當模型被要求更長時間推理以及接受更多後訓練時,可控性下降。例如,OLMo-3-7B-RL-Zero-Math 在 RL 訓練期間的可控性分數下降超過十倍。
- 對抗情境: 告知模型它們正被監控(「監控意識」)或評估(「評估意識」)會略微提升可控性,但提升不顯著。自動化提示優化在訓練集上帶來的提升未能遷移至新指示類型。
對 AI 安全與監控的影響
低 CoT 可控性被視為安全特性而非缺陷。它確保 CoT 監控更可信,因為模型無法輕易隱藏其內部推理步驟以欺騙監控者。
然而,OpenAI 指出,低可控性並不保證高可監控性。可監控性仍可能透過其他機制下降,例如對思考鏈的直接優化壓力。
未來展望與監控
OpenAI 將把 CoT 可控性評估視為「金絲雀評估」——一種早期警示系統,用以偵測模型在進步過程中是否具備塑造或隱藏其推理的能力。為了保持透明度,OpenAI 將在未來前沿模型的系統卡中,同時報告 CoT 可控性與 CoT 可監控性,首個模型為 GPT-5.4 Thinking。