OpenAI 評估思考鏈可監測性
OpenAI 引入了一個系統化框架來評估「可監測性」,其定義為監測者預測代理行為中感興趣的屬性(例如欺騙、獎勵駭客或偏見推理)的能力。核心發現是,監測模型的內部思考鏈(CoT)比僅監測其最終行動和輸出更為有效,尤其在模型規模擴大且「思考」時間更長時。
可監測性框架
為了具體衡量模型推理的透明度,OpenAI 開發了一套包含 13 項評估、跨 24 個環境的測試。這些評估分為三種原型:
- 介入評估:這些評估在環境中引入受控變化,以觀察監測者是否能透過 CoT 中的證據偵測行為變化的 原因。
- 過程評估:這些評估聚焦於解答路徑有限的任務(例如數學題),以判斷監測者是否能辨識模型實際採取的具體步驟。
- 結果屬性評估:這些評估測試監測者是否能根據模型的推理,預測輸出的可測量屬性——例如程式碼任務中的獎勵駭客行為。
這些評估涵蓋各種行為光譜,包括中性任務、諂媚、偏見以及一般的錯位(作弊或說謊)。
模型擴展與強化學習的關鍵發現
OpenAI 研究模型規模與訓練如何影響可監測性的演變,揭示了若干關鍵趨勢:
強化學習(RL)的影響
與擔心 RL 可能激勵模型隱藏推理或漂移至不可監測狀態的觀點相反,OpenAI 發現,在當前前沿規模下的 RL 優化並未實質降低可監測性。某些情況下,它甚至提升了推理過程初始步驟的可監測性。
「可監測性稅」
已記錄的模型大小與推理努力之間存在權衡。OpenAI 觀察到,較小的模型在較高的推理努力下,能達到與較大模型在較低推理努力下相當的能力,但較小的模型更易於監測。這種以略微降低能力為代價,換取顯著提升可監測性的權衡,被稱為「可監測性稅」。
推理努力與效能
隨著模型產生更長的思考鏈,可監測性通常會提升。此外,研究顯示,使用更強大的模型作為監測者,並提升這些監測者的推理努力,能更精確預測代理的行為。
透過追問提升可監測性
OpenAI 發現,事後透過針對被監測屬性提出追問(例如「你有做什麼可疑的事嗎?」)可以提升可監測性。
初步結果顯示,這些追問能提升可監測性,尤其在較低的初始推理努力下。關鍵在於,提升來源於追問所產生的 思考鏈,而非提供給使用者的最終答案,這暗示模型在內部推理上可能比直接回應更為坦率。
可擴展控制的啟示
隨著 AI 系統超越人類水平,直接的人類監督變得不切實際。OpenAI 主張,CoT 監測可作為可擴展控制方案中的「承重控制層」,由可信但較弱的監測者監督更強大的代理。
此方法被視為機制可解釋性的補充。透過將 CoT 監測與其他可解釋性方法結合,OpenAI 旨在構建「深度防禦策略」,確保高度能力模型的安全部署。