OpenAI 宣佈使用人類回饋強化學習與 InstructGPT 的對齊策略

TL;DR

OpenAI 宣布,人類回饋強化學習 (RLHF) 與 InstructGPT 系列是其對齊已部署語言模型的主要工具,僅使用不到 GPT‑3 預訓練計算量的 2 % 即可達到強烈的人類偏好,但這些模型仍存在顯著的不足,實驗室計畫使用更強大的模型來自動化對齊研究。

以人類回饋強化學習作為核心對齊技術

OpenAI 表示 人類回饋強化學習 (RLHF) 是目前用於對齊其已部署語言模型的主要技術。透過使用人類產生的偏好資料微調如 GPT‑3 等預訓練模型,OpenAI 創造出一類稱為 InstructGPT 的模型,這些模型被訓練成同時遵循明確指示與隱含意圖,例如真實性、公平性與安全性。

InstructGPT 的效率與效能

  • 人類偏好:InstructGPT 在使用者偏好上勝過一個規模大 100 倍的預訓練模型。
  • 計算成本:微調 InstructGPT 所需的 計算量 < 2 %,相較於 GPT‑3 原始預訓練所需的計算量。
  • 人類回饋投入:微調過程大約耗費 20,000 小時的人類回饋
  • 客戶偏好:實務上,OpenAI 的 API 客戶已經偏好使用 InstructGPT 而非原始的預訓練模型。

這些結果顯示,只需相對適度的額外資源,即可取得顯著的對齊提升。

InstructGPT 的現行限制

OpenAI 承認 目前的 InstructGPT 版本仍遠未完全對齊。具體的失效模式包括:

  • 無法可靠地遵循簡單指示。
  • 真實性不一致。
  • 未能拒絕有害請求。
  • 偶爾產生偏見或有毒的輸出。
  • 相較於基礎預訓練模型,創造力下降,這一缺點在公開基準測試中未被捕捉。

實驗室正積極研究 RLHF 的更深層科學理解,以及提升人類回饋品質的方法。

對齊研究基礎設施

OpenAI 的 自然語言 API 成為對齊實驗的回饋迴路,向模型提供多樣化的真實世界任務,這些任務正是客戶實際付費使用的。此環境使得對齊技術的實務評估能夠快速進行。

超越現有模型的對齊規模化

  • 與 AGI 對齊的區別:對 API 進行對齊較對人工通用智慧 (AGI) 容易,因為任務可由人類監督,且模型的智慧不超過人類。
  • RLHF 的角色:雖然單靠 RLHF 不太可能解決 AGI 對齊問題,但它被視為 可規模化對齊提案的核心構件
  • 尚無永續可擴展解決方案:OpenAI 指出,目前尚未發現可永久擴展的對齊方法,且隨著 AI 能力提升,將會出現新的對齊挑戰。

務實路線圖:AI 輔助的對齊研究

OpenAI 提出 務實的做法

  1. 構建能比人類更快加速對齊研究的系統
  2. 讓 AI 系統接管更多對齊任務,最終能構思、實作與評估新對齊技術。
  3. 將人類的努力轉向審查 AI 產出的對齊工作,而非自行產出。
  4. 針對在相關領域具有人類水平能力的較窄 AI 系統,這類系統預期較易於對齊,較之通用或超人系統更具可行性。

為何語言模型適合自動化對齊

  • 它們從網路文本中獲得了豐富的人類價值知識。
  • 它們不是獨立的代理人,亦不會追求自主目標。
  • 對齊任務往往可表述為自然語言或程式碼問題,正好契合模型的強項。

未來的對齊助理

OpenAI 提到,未來的 WebGPT、InstructGPT 與 Codex 版本可能成為 對齊研究助理,儘管目前尚未具備足夠能力作出實質貢獻。實驗室計畫 訓練一個可用於對齊研究的模型,並在其能力足夠時向外部對齊社群開放


此貼文忠實反映 OpenAI 於 2022 年 8 月公布的對齊研究策略,未加入或推測超出原文的內容。

SUMMARY: OpenAI 詳述其對齊方法,強調人類回饋強化學習與 InstructGPT 為低成本且有效的手段,使語言模型能遵循人類意圖,同時承認目前的限制與未來 AI 驅動的對齊研究目標。

TITLE: OpenAI 宣佈使用人類回饋強化學習與 InstructGPT 的對齊策略

Sources