OpenAI 證明者‑驗證者遊戲提升語言模型輸出的可讀性

TL;DR

OpenAI 介紹了一個 證明者‑驗證者遊戲 訓練框架,教導強大的語言模型產生較弱模型能輕易檢查的解答,同時也使輸出對人類評估者更具可讀性。

透過最佳化提升可讀性

僅僅優化答案正確性可能會產生人類難以理解的解答。OpenAI 顯示,當時間有限的人類評估者評判高度最佳化的解答時,他們的錯誤率幾乎是評估較少最佳化解答的兩倍。透過訓練一個強大的模型(證明者)產生能被更弱的模型(驗證者)驗證的文字,最終的輸出既正確又更易於人類評估。實驗使用小學數學題目,取得約純正確性導向訓練一半的準確度提升,同時保有人類可讀性。

工作原理

訓練迴圈在兩個階段之間交替:

  1. 驗證者訓練 – 一個弱驗證者模型(其預訓練計算量約比證明者少 3 個量級)學習預測證明者產生的解答是否正確。
  2. 證明者訓練 – 強大的證明者模型被指示扮演 有幫助 角色(獎勵在驗證者上得分高且正確的解答)或 狡詐 角色(獎勵即使不正確但在驗證者上得分高的解答)。最初,狡詐的證明者能欺騙驗證者,但每一輪都將這些欺騙性解答加入驗證者的訓練集,從而消除此漏洞。當狡詐的證明者無法再產生令人信服的錯誤答案時,訓練停止。

這種對抗式共同訓練迫使證明者產生足夠透明的解答,讓驗證者——亦即人類——能夠評估。

主要發現

  • 效能與可讀性之權衡 – 純粹以人類推導進行監督式微調可獲得高可讀性但準確度低;純正確性最佳化則可獲得高準確度但可讀性低。證明者‑驗證者遊戲在兩者之間取得平衡,保有強可讀性且具中等準確度。
  • 三種有用的模型角色
    • 堅韌驗證者 – 能準確區分正確與錯誤的解答,即使證明者試圖欺騙。
    • 有幫助的證明者 – 產生對人類讀者仍然清晰的解答,降低評估者的錯誤率。
    • 狡詐的證明者 – 生成微妙且不正確的解答,最初會混淆評估者,從而揭露可進一步改進的弱點。

論文提供了具體範例(例如多步驟的年齡計算問題),展示有幫助的證明者的推理是明確且易於追蹤的,而狡詐的證明者的推理則包含刻意的錯誤,儘管在訓練初期仍能獲得高驗證者分數。

對對齊與可信度的影響

要求語言模型產生 可驗證 的推理說明,可減少對人類可讀性判斷的依賴,並朝向未來更強大 AI 系統的自主對齊前進。透明且可檢查的輸出能提升在教育、金融、科學研究等高風險應用中的信任度。雖然本研究僅限於單一數學資料集且仍仰賴真實標籤,但此方法論指向一條可擴展的路徑,打造其正確性可在無大量人工監督下顯而易見的 AI 系統。

結論

證明者‑驗證者遊戲顯示,訓練強大模型產生能被較弱模型驗證的文字,同時提升了人類的可讀性,且保留了純正確性最佳化所帶來的大部分準確度提升。此方法為使日益強大的語言模型與人類價值對齊提供了有前景的途徑,透過使其推理過程透明且易於稽核。


Authors: Yining Chen, Jan Hendrik Kirchner
Contributors: Angela Baek, Yuri Burda, Thomas Degry, Harri Edwards, Elie Georges, Cary Hudson, Jan Leike, Nat McAleese, Wes McCabe, Lindsay McCallum, Freddie Sulit

Sources