OpenAI 弱至強概括研究
OpenAI 提出了超對齊的新研究方向,展示了可以使用 GPT-2 級別的模型來監督更大的模型(GPT-4),以引發接近 GPT-3.5 表現水平的能力。此研究至關重要,因為它暗示我們可以利用深度學習的概括特性,透過弱監督者來控制強模型,這是對齊未來超人類 AI 系統的必要步驟。
超對齊問題
未來的 AI 系統可能很快就會達到超智慧——遠超人類的 AI。超對齊的核心挑戰在於,人類作為「弱監督者」必須可靠地引導與控制遠比人類更具能力的 AI 系統。
傳統的對齊方法,例如來自人類回饋的強化學習(RLHF),依賴人類監督。然而,這些方法在面對超人類模型時可能無法良好擴展,因為人類無法可靠地監督極其複雜的行為,例如產生數百萬行新穎且可能危險的程式碼,超出人類專家的理解範圍。
實驗設置:小到大模型監督
為了實證研究超對齊問題,OpenAI 研究人員使用了一個代理類比:以較小、能力較弱的模型來監督較大、能力較強的模型。
核心問題在於,強大的預訓練模型是否能根據弱監督者的底層意圖進行概括,而非僅僅模仿弱監督者的錯誤。由於強模型擁有潛在知識,目標是利用較小模型的監督訊號來引發這些知識。
主要結果與發現
OpenAI 發現他們能在多種情境下顯著提升概括能力。透過使用一種鼓勵強模型更有信心的方法——包括在必要時自信地與弱監督者持不同意見——他們僅以 GPT-2 級別的監督在自然語言處理任務上,就能恢復大部分 GPT-4 的能力。最終模型的表現通常介於 GPT-3 與 GPT-3.5 之間。
- 概括到困難問題: 強模型即使在弱監督者失敗的困難問題上也能正確概括。
- 替代方法: 研究人員在其他方法中觀察到「生機」的跡象,例如從小模型到中等模型再到大模型的自舉,以及最佳的提前停止。
- 限制: 此方法僅為概念驗證,且目前無法在 ChatGPT 偏好資料上運作。
對 AI 對齊的影響
結果顯示,雖然天真的人類監督(如 RLHF)在超人類模型上可能無法良好擴展,但顯著提升弱到強概括是可行的。
然而,研究人員指出一個潛在的類比不當:未來的超人類模型可能比目前的強模型更容易模仿人類錯誤,而非模仿當前弱模型的錯誤。這可能使未來的對齊比目前的代理實驗所暗示的更為困難。
社群資源與補助金
為了加速此領域的研究,OpenAI 已釋出開源程式碼以促進弱到強概括實驗,並啟動了一項 1,000 萬美元的補助金計畫,支援專注於超人類 AI 對齊的研究生、學者與其他研究者。
Sources
- OriginalWeak-to-strong generalization