學習透過人類回饋進行摘要生成
OpenAI 已將人類回饋強化學習 (RLHF) 應用於訓練用於文本摘要的語言模型,發現這種方法比標準的監督式學習顯著提升了摘要品質。研究人員證明,一個透過人類回饋訓練的 1.3 billion parameter 模型,其表現可以超越僅透過監督式學習訓練的 12 billion parameter 模型。
RLHF 在摘要生成中優於模型規模擴展
與其單純增加模型大小或依賴監督式微調,人類回饋強化學習提供了一條更有效實現高品質摘要的途徑。在比較評估中,Reddit 資料集中的 1.3B 和 6.7B 人類回饋模型生成的摘要,比起原始人類撰寫的 "TL;DR" 摘要更受人類標註員的青睞。
雖然標註員表現出對較長摘要的偏好——這導致模型趨向於收斂至最大允許長度——但若在控制長度的情況下,對 6.7B 模型摘要的偏好度僅略微下降(從 70% 降至 65%),這表明品質的提升並非主要由摘要長度所驅動。
泛化能力與對新聞資料集的遷移能力
在 Reddit TL;DR 資料集上訓練的模型,無需額外微調即可有效地遷移到其他領域。當應用於 CNN/DailyMail 新聞資料集時——該資料集包含的文章長度是 Reddit 貼文的兩倍以上,且使用不同的寫作風格——人類回饋模型仍能生成高品質的短摘要。
在控制長度的情況下,6.7B 人類回饋模型生成的摘要,其評分比 CNN/DM 資料集中的人類撰寫參考摘要還要高。這表明 RLHF 過程有助於模型學習摘要生成的通用原則,而非僅僅是模仿訓練資料的特定風格。
RLHF 的技術方法
訓練過程包含四個主要階段:
- 初始模型訓練:首先透過監督式學習微調 GPT-style transformer models (1.3B and 6.7B parameters) 以預測人類撰寫的 TL;DRs。
- 人類比較數據收集:人類比較同一貼文的兩個不同摘要,並選擇較佳的版本。主要模型是在約 65,000 次比較中進行訓練的,儘管在僅有 8,000 次比較時也能看到有效結果。
- 獎勵模型訓練:訓練一個獎勵模型來預測人類偏好,將 (post, summary) 對映射到一個獎勵值。
- RL 微調:使用 Proximal Policy Optimization (PPO) 在 100 萬個 episode 中針對獎勵模型進行摘要策略的優化。使用 KL penalty 以確保策略與初始監督式模型保持接近。
數據品質與獎勵優化
為了避免模型從低品質標籤中學習到平均化行為的問題,OpenAI 實施了嚴格的數據品質控制:
承包商管理:OpenAI 並非採用群眾外包,而是聘請了約 80 名按時薪支付的承包商,以確保建立直接的互動關係,包括入職培訓以及透過聊天和視訊通話進行直接溝通。
協議一致性監控:研究人員密切監控標註員與其自身判斷之間的一致性率。
優化強度:團隊發現,過度優化獎勵模型最終會導致性能下降。研究發現,最佳樣本的預測獎勵值大約等於資料集中參考摘要的第 99 百分位數。
限制與計算需求
儘管性能有所提升,研究人員仍指出了幾個關鍵限制:
行為定義:RLHF 優化的是定義好的行為,但並不能決定該行為「應該」是什麼。對於複雜任務,研究人員建議將受影響的群體納入「良好」行為的定義中。
資料集偏差:由於 Reddit TL;DR 資料集包含極少審核的內容,模型可能會生成具有冒犯性或反映有害社會偏見的摘要。
計算成本:擴展獎勵模型和策略模型是資源密集型的;微調 6.7B 模型大約需要 320 GPU-days。
性能差距:模型尚未達到絕對的人類水平。在涵蓋準確性、覆蓋率和連貫性的 7 分制評分中,模型給出的完美總分佔 45% 的次數,而參考摘要的比例為 23%。
未來方向
OpenAI 的目標是將人類回饋擴展到人類難以評估的任務,例如需要大量研究才能驗證的提問。提出的解決方案包括開發 ML-powered tools 來幫助人類更精確地評估輸出。此外,實驗室也在探索除了二元比較之外的其他回饋類型,例如人類示範、對模型輸出的直接編輯,以及對偏好的詳細解釋。