Anthropic 研究:將通用語言助手作為對齊實驗室

Anthropic 開發了一套框架,用於創建一個與人類價值觀對齊的通用文本助手——具體定義為提供幫助、誠實且無害。該研究證明,對齊干預措施會隨著模型規模的擴大而產生正向的擴展性,且排序偏好建模(ranked preference modeling)是實現這些目標最有效的訓練目標。

對齊目標與基準評估

Anthropic 對通用語言助手的研究重點在於確保模型是提供幫助、誠實且無害的。為了建立基準,實驗室研究了諸如提示(prompting)等簡單的干預措施。研究結果顯示,在提示中進行適度的干預可以帶來好處,且這些好處會隨著模型規模的增長而增加。這些改進在各種對齊評估中具有泛化能力,且不會降低大型模型的整體性能。

訓練目標的比較分析

與模仿學習(imitation learning)和二元判別(binary discrimination)相比,排序偏好建模是使語言模型對齊最有效的訓練目標。Anthropic 研究了幾種目標的擴展趨勢,包括:

  • Imitation Learning: 一種基準方法,模型學習模仿特定的範例。
  • Binary Discrimination: 一種技術,模型在兩個選項之間進行區分。
  • Ranked Preference Modeling: 一種技術,模型從人類價值的排序偏好中學習。

研究結論指出,排序偏好建模的表現顯著優於模仿學習,且通常隨著模型規模的增加而呈現更佳的擴展性。研究發現二元判別的表現和擴展性與模仿學習相似,相對於基礎的模仿方法,幾乎沒有提供額外的益處。

透過偏好預訓練提高樣本效率

為了優化訓練過程,Anthropic 研究了「偏好模型預訓練」(preference model pre-training)階段。此階段的目標是在隨後的基於人類偏好的微調過程中提高樣本效率,從而減少實現高對齊性能所需的人類標註數據量。

Sources

相關