透過辯論的 AI 安全
OpenAI 提出了一種新的 AI 安全技術,透過訓練代理人相互辯論主題,並以人類裁判決定勝負。此方法旨在讓人類能夠監督執行認知高度複雜、難以直接由人類評估的任務的 AI 系統。
AI 對齊的辯論框架
AI 對齊常依賴人類在訓練過程中辨識安全且有用的行為。然而,當代理人的行為過於複雜以致人類無法理解,或任務過於困難以致難以判斷時,這種方法就會失效。為了解決此問題,OpenAI 建議將學習問題重新構築為兩個代理人爭論立場的遊戲,而人類則擔任裁判。
核心前提是,即使 AI 代理人對問題的理解比人類裁判更為先進,人類仍能判斷哪一位代理人提出了較佳的論點。代理人透過自我對弈進行訓練,類似 AlphaGo Zero 所使用的方法。目標是迫使辯論聚焦於越來越簡單的事實爭議,直至得到足以讓人類正確判斷的簡單主張。
概念驗證:稀疏 MNIST 分類器
為了在受控環境中測試此概念,OpenAI 使用 MNIST 資料集進行實驗。在此設定中,「裁判」是一個僅從六個隨機非黑色像素預測數字的分類器。兩位辯論者對圖像擁有完整的資訊,但裁判對大部分圖像「盲目」無法看見。
MNIST 實驗的主要結果包括:
- 準確率提升:當辯論者必須事先宣告立場時,稀疏分類器的準確率從 59.4% 提升至 88.9%。
- 誠實 vs. 惡意對弈:一個代理人誠實地協助裁判正確猜測,另一個則試圖欺騙裁判。誠實的玩家勝率為 88.9%。
- 錯誤模式:辯論中成功的謊言集中在數字 8 與 9,暗示某些數字較易被誤傳。
以人為中心的測試:貓與狗辯論
OpenAI 開發了一個原型網站,以測試在人類參與者擔任辯論者與裁判時的辯論機制。在這些「貓 vs. 狗」辯論中,辯論者可以使用自然語言闡述立場,但只能揭示圖像中唯一一個保證真實的像素以解決爭議。
OpenAI 的非正式測試顯示,誠實的代理人通常會獲勝,因為隨著辯論的進行,謊言越來越難以維持,且代理人會聚焦於特定的爭議事實。研究人員指出,限制裁判索取資訊的速度可以使遊戲對說謊者更公平,因為構造詳細的謊言在認知上相當吃力。
限制與未來方向
雖然辯論模型提供了一種為複雜目標產生訓練訊號的方法,但它仍有多項根本性的限制:
- 魯棒性:辯論並未處理對抗樣本或分布轉移;它僅是一種訓練訊號的方法,並不保證系統的魯棒性。
- 理論保證:沒有理論保證自我對弈必定能達到最佳策略或正確陳述。
- 計算成本:訓練以辯論的代理人比訓練直接給出答案的代理人需要更多計算資源。
- 人類裁判的限制:人類裁判可能過於偏頗,或即使在辯論已縮小至簡單事實時,仍缺乏足夠的認知能力作出正確判斷。
未來的工作將聚焦於更具挑戰性的視覺實驗、自然語言辯論,以及測試系統在涉及價值觀的問題上如何處理,因為此類問題可能受到人類偏見的影響。
Sources
- OriginalAI safety via debate