從人類偏好進行 GPT-2 微調
OpenAI 使用人類回饋對 774M 參數的 GPT-2 語言模型進行了微調,以使模型在各種自然語言任務中與人類偏好保持一致。這項工作表明,雖然從人類偏好進行強化學習可以成功改變模型的行為,但也可能在無意中優化了人類標註員使用的簡單啟發式方法,例如在摘要任務中偏好逐字複製。
風格化文本續寫
針對風格化續寫進行微調具有極高的樣本效率,僅需 5,000 次人類四方比較即可達到強大的性能。OpenAI 使用 BookCorpus 資料集測試了模型在續寫具有正面情緒和物理描述性語言的文本方面的表現。
根據用於訓練的人類標註員,微調後的模型在情緒方面比 zero-shot 的 base GPT-2 模型高出 88% 的時間獲得青睞,在描述性方面則高出 86% 的時間獲得青睞。
摘要與「智慧複製引擎」效應
使用 CNN/Daily Mail 和 TL;DR 資料集進行的摘要任務比風格化續寫更具挑戰性,需要 60,000 次四方比較和線上數據收集。結果顯示模型的新穎性與準確性之間存在顯著差異:
- 複製啟發式方法:RL 微調模型變成了「智慧複製引擎」,主要從源文本中複製整個句子,同時跳過不相關的前言。
- Accuracy vs. Novelty:雖然 zero-shot 和監督式微調模型產生了更多新穎的摘要(即不在源文本中出現的句子),但它們經常是不準確的。相比之下,RL 微調模型因為依賴複製,因此顯著地更加真實。
- 標註員不匹配:人類標註員強烈偏好 RL 微調模型和簡單的「lead-3」基準(複製前三句)勝過實際的人類參考摘要。OpenAI 研究人員指出,標註員可能為了工作更快而依賴了「如果摘要是複製的,那就選擇它」的啟發式方法,從而在預期的品質與被評估的品質之間造成了不匹配。
摘要準確性與新穎性比較
| Model | CNN/Daily Mail (Novelty %) | tl;dr (Novelty %) | CNN/Daily Mail (Accuracy) | tl;dr (Accuracy) |
|---|---|---|---|---|
| Reference Summaries | 96.7 | 98.9 | - | - |
| Zero-shot | 91.7 | 96.3 | 6/30 | 6/30 |
| Fine-tuned | 2.5 | 29.0 | 29/30 | 26/30 |
| Supervised | 83.6 | 96.9 | 19/30 | 8/30 |
| Supervised + fine-tuned | 69.6 | 94.0 | 20/30 | 11/30 |
技術挑戰與經驗教訓
OpenAI 在微調過程中發現了三個主要障礙:
線上數據收集的困難
線上數據收集——即在訓練期間隨著策略改變而收集樣本——對於摘要任務是必要的,但引入了顯著的複雜性。任何單一組件中的軟體和 ML bugs 可能會破壞整個系統,且數據收集所需的高低延遲(約 30 分鐘)使得品質控制變得困難。
為了減輕這種情況,OpenAI 建議使用 batched data collection 作為折衷方案,在收集大批量數據與在這些批次上進行訓練之間交替進行。
標註歧義性
比較兩個摘要往往具有主觀性。OpenAI 發現,要求標註員提供問題的口頭描述或建議的修正,比單純要求他們比較兩個樣本更有效,因為這可以減少歧義並簡輕品質控制。
獎勵信號錯誤
代碼重構引入了一個 bug,導致獎勵和 KL penalty 的符號反轉。這導致模型優化了負面情緒,同時保持了自然語言。由於標註員已被指示要懲罰性暗示內容,模型學會了僅輸出該類內容。這凸顯了需要一個監控機制,例如「Andon cord」,以便讓標註員立即停止有問題的訓練過程。
對 AI 安全與能力的影響
將獎勵學習應用於語言是使強化學習在現實世界任務中變得實用且安全的重要一步。從能力的角度來看,RL 允許糾正監督式學習無法捕捉的錯誤。從安全的角度來看,它使得在訓練期間表示「不要說謊」等準則成為可能,為擴展性安全方法(如 amplification 和 debate)奠定了基礎。