OpenAI InstructGPT: 讓語言模型對齊以遵循指令

OpenAI 已開發 InstructGPT,這是一組語言模型,設計為比 GPT-3 更緊密地對齊使用者意圖。透過利用人類回饋強化學習(RLHF),InstructGPT 提升了遵循指令的能力,增加了真實性,並減少了毒性內容的產生。

改進的指令遵循與安全

循與安全

InstructGPT 在遵循英文指令及提供有用輸出方面顯著優於 GPT-3。儘管 GPT-3 是在大規模互聯網文本數據集上訓練以預測下一個詞——這常導致不真實或有毒的輸出——InstructGPT 被專門對齊以執行使用者實際想要完成的任務。

關鍵效能提升包括:

  • 更高的使用者偏好: 人類標註者顯著偏好 InstructGPT 的輸出勝過 GPT-3,即使 GPT-3 被提供少樣本提示以進入「遵循指令模式」。
  • 規模效率: 標註者偏好 1.3B 參數的 InstructGPT 模型勝過 175B 參數的 GPT-3 模型,儘管前者的參數量少了超過 100 倍。
  • 降低毒性與虛假: 根據 RealToxicityPrompts 和 TruthfulQA 基準,InstructGPT 產生較少的模仿性虛假內容,且毒性低於 GPT-3。
  • 降低幻覺率: 人類對 API 提示分佈的評估顯示,InstructGPT 編造事實的頻率較低,並產生更適當的回應。

RLHF 訓練方法

InstructGPT 透過三步驟的人類回饋強化學習(RLHF)流程進行訓練,以「解鎖」預訓練 GPT-3 模型中已存在的能力:

  1. 監督微調: 標註者在 API 提交的提示上提供期望模型行為的示範。
  2. 獎勵模型訓練: 標註者對多個模型輸出進行排名,並訓練獎勵模型(RM)來預測人類會偏好哪個輸出。
  3. PPO 微調: 使用 PPO 演算法對 GPT-3 的策略進行微調,以最大化由 RM 提供的獎勵訊號。

為防止「對齊稅」——即模型在對齊客戶偏好時,在學術 NLP 任務上的表現下降——OpenAI 將原始 GPT-3 預訓練數據的一小部分混入 RL 微調過程,採用普通對數似然最大化。此方法在保持安全與偏好對齊的同時,維持甚至提升了在學術基準上的表現。

泛化與偏好對齊

OpenAI 測試 InstructGPT 是否過度適應其訓練標註者的特定偏好。實驗顯示,未參與訓練數據的持出標註者(那些未產生訓練資料的標註者)對 InstructGPT 輸出的偏好與訓練標註者相同。此外,在部分標註者上訓練的獎勵模型在其他子集上也能良好泛化,顯示模型對齊的是更廣泛的偏好,而非僅特定一組標註者。

當前限制與安全風險

儘管有這些進步,InstructGPT 尚未完全對齊或完全安全。OpenAI 指出幾個持續的挑戰:

  • 剩餘風險: 模型仍會在未明確提示的情況下產生有偏見、有毒或帶有性與暴力內容。
  • 濫用易感性: 由於模型在遵循指令方面更優秀,若被明確指示產生不安全輸出,可能更易濫用。可靠地拒絕有害指令仍是一個開放的研究問題。
  • 文化偏差: 因模型是以英文指令訓練,因此偏向英語使用者群體的文化價值觀。

為降低這些風險,OpenAI 持續審查潛在應用、提供用於檢測不安全補全的內容過濾器,並監控濫用情況。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch