Anthropic: 使用 RLHF 訓練一個有幫助且無害的助手

Anthropic 開發了一種方法,透過偏好建模和來自人類回饋的強化學習 (RLHF) 將語言模型微調為有幫助且無害的助手。這種對齊過程增強了幾乎所有 NLP 評估中的表現,並且仍與摘要和 Python 編碼等專業任務的訓練相容。

RLHF 用於模型對齊與性能

來自人類回饋的強化學習 (RLHF) 被用於將語言模型與人類偏好對齊,特別專注於「有幫助」和「無害」這兩個目標。這種對齊訓練並不會為了安全性而犧牲通用能力;相反地,它改善了幾乎所有 NLP 評估的表現。此外,RLHF 與獲取專業技能(例如 Python 編碼和摘要)完全相容,這表明對齊可以與高水平的技術熟練度並存。

迭代式線上訓練方法論

為了高效地改進數據集和模型,Anthropic 採用了迭代式的線上訓練模式。在這種方法中,偏好模型和 RL 策略會以週為週期,使用新鮮的人類回饋數據進行更新。這種迭代循環允許模型根據當現在的表現和新的人類輸入來演進,從而建立一個持續精煉的閉環。

魯棒性與 RL 獎勵分析

對 RLHF 訓練魯棒性的研究揭示了獎勵與策略偏離其起始點之間的特定數學關係。具體而言,RL 獎勵與策略及其初始化之間的 KL 散度平方根之間存在大約線性的關係。

其他技術分析

除了主要的 RLHF 結果之外,研究還包括幾項周邊分析,以確保模型的穩定性和可靠性:

  • Calibration and Objectives: 調查模型的信心度如何與準確度對齊,以及如何平衡相互競爭的目標(例如有幫助性 vs. 無害性)。
  • OOD Detection: 使用 Out-of-Distribution (OOD) 檢測來識別模型無法處理的提示詞 (prompts)。
  • Human Comparison: 將模型輸出與人類作者產生的輸出進行比較,以基準化品質和語氣。
  • Prompt Testing: 使用源自近期相關研究的提示詞來評估模型,以測試一致性和安全性。

Sources

相關