說明人類回饋強化學習 (RLHF)
Reinforcement Learning from Human Feedback (RLHF) 是一種用於使在一般文本語料庫上訓練的大型語言模型(LLM)與複雜的人類價值與偏好對齊的方法。此過程讓模型超越簡單的下一個 token 預測,根據主觀的人類標準產生有幫助、真實或具創意的文本。
RLHF 的三步驟流程
RLHF 是一個多階段的訓練管線,涉及多個模型與不同的部署階段。此流程分為預訓練、獎勵建模與強化學習微調三個階段。
1. 語言模型的預訓練
此流程從使用傳統目標預訓練的語言模型開始。此基礎模型必須能夠回應各種指令。作為起始點的模型範例包括用於 InstructGPT 的較小版 GPT-3、Anthropic 研究中參數介於 1,000 萬至 520 億的 transformer 模型,以及 DeepMind 的 2800 億參數 Gopher 模型。
雖非絕對必要,但部分組織會使用增強資料進一步微調基礎模型。OpenAI 以「較佳」的人類生成文本進行微調,而 Anthropic 則透過上下文線索蒸餾原始 LM,以符合「有幫助、誠實且無害」的標準。
2. 獎勵模型訓練
獎勵模型(Reward Model,RM)或偏好模型,旨在接受一段文字序列並回傳一個代表人類偏好的標量獎勵。此標量輸出對於與強化學習演算法的結合至關重要。
資料收集與排序 為了訓練 RM,會從資料集抽樣提示,並透過初始 LM 產生多個文字輸出。之後由人工標註者對這些輸出進行排序。由於人類直接給予標量分數往往噪聲大且未校準,會使用排序(例如使用 Elo 系統的對決比賽)來建立更正規化的資料集。
模型架構 獎勵模型可以是微調過的 LM,或是從頭訓練的模型。例如,Anthropic 使用 Preference Model Pretraining(PMP)提升樣本效率。獎勵模型的規模依實作而異;OpenAI 為 175B LM 使用了 6B 的獎勵模型,而 DeepMind 則為 LM 與獎勵模型皆使用 70B 的 Chinchilla 模型。
3. 使用強化學習微調
最後階段使用策略梯度的 RL 演算法,通常是近端策略最佳化(Proximal Policy Optimization,PPO),根據獎勵模型的回饋來優化初始 LM 的副本。
RL 公式化
- Policy: 接收提示並回傳文字序列的語言模型。
- Action Space: 語言模型的詞彙表(通常約 5 萬個 token)。
- Observation Space: 可能的輸入 token 序列的分佈。
- Reward Function: 結合偏好模型的標量獎勵 ($r_{\theta}$) 與對策略變動的懲罰 ($r_{\text{KL}}$)。
KL 散度懲罰 為防止模型產生「欺騙」獎勵模型的胡言亂語(reward hacking),會根據 Kullback–Leibler(KL)散度施加懲罰。若 RL 策略偏離初始預訓練模型過遠,則會受到懲罰,以確保輸出保持連貫。
最終的獎勵計算為:$r = r_{\theta} - \lambda r_{\text{KL}}$。
更新規則 PPO 被用作信任域優化演算法,以確保梯度更新不會使學習過程不穩定。雖然 PPO 很常見,DeepMind 也在類似設定中使用同步優勢演員-評論家(A2C)。
RLHF 的開源工具
多個基於 PyTorch 的倉庫協助實作 RLHF:
- TRL (Transformers Reinforcement Learning): 用於在 Hugging Face 生態系統中使用 PPO 微調預訓練 LM 的工具。
- TRLX: 由 CarperAI 所分支的 TRL,針對更大型模型(目前最高 33B 參數,目標 200B)進行最佳化,並支援 Implicit Language Q-Learning(ILQL)。
- RL4LMs: AllenAI 提供的函式庫,提供各種 RL 演算法(PPO、NLPO、A2C、TRPO)以及可自訂的獎勵函數之建構模組。
限制與未來方向
儘管取得成功,RLHF 仍面臨多項技術與營運挑戰:
- Data Cost(資料成本): 收集人類偏好資料成本高昂。高品質的人類生成文本尤其昂貴,儘管偏好標籤(約 5 萬樣本)較易取得。
- Human Variance(人類差異): 標註者常有分歧,導致訓練資料中出現變異,且缺乏絕對真相。
- Model Imperfection(模型不完美): 模型仍可能產生有害或事實不正確的文本,且不會表達不確定性。
潛在改進 未來研究聚焦於改進 RL 優化器。由於獎勵模型需要對每段生成文本進行昂貴的前向傳播,離線 RL 以及類似 Implicit Language Q-Learning(ILQL)的演算法正被探索,以作為更高效的策略優化器。