Anthropic: RLHFを用いた有益で無害なアシスタントのトレーニング

Anthropicは、選好モデリングと人間からのフィードバックによる強化学習(RLHF)を使用して、言語モデルを有益で無害なアシスタントへと微調整する手法を開発しました。このアライメントプロセスは、ほぼすべてのNLP評価においてパフォーマンスを向上させ、要約やPythonコーディングのような専門的なタスクのトレーニングとも互換性があります。

RLHFによるモデルのアライメントとパフォーマンス

人間からのフィードバックによる強化学習(RLHF)は、言語モデルを人間の選好に合わせるために使用され、特に「有益であること」と「無害であること」という2つの目標に焦点を当てています。このアライメントトレーニングは、安全性のために汎用的な能力を犠牲にするものではありません。むしろ、ほぼすべてのNLP評価においてパフォーマンスを向上させます。さらに、RLHFはPythonコーディングや要約といった専門的なスキルの習得とも完全に互換性があり、アライメントが高度な技術的習熟度と共存できることを示しています。

反復的なオンライントレーニング手法

データセットとモデルを効率的に改善するために、Anthropicは反復的なオンラインモードのトレーニングを採用しています。このアプローチでは、選好モデルとRLポリシーは、新しい人間のフィードバックデータを使用して週単位のペースで更新されます。この反復的なサイクルにより、モデルは現在のパフォーマンスと新しい人間の入力に基づいて進化し、継続的な洗練のループが作成されます。

堅牢性とRL報酬分析

RLHFトレーニングの堅牢性に関する研究では、報酬とポリシーの初期状態からの乖離(divergence)との間に特定の数学的な関係があることが明らかになりました。具体的には、RL報酬と、ポリシーとその初期化状態との間のKLダイバージェンスの平方根との間に、ほぼ線形な関係があります。

追加の技術的分析

主要なRLHFの結果に加えて、この研究にはモデルの安定性と信頼性を確保するためのいくつかの周辺的な分析が含まれています。

  • Calibration and Objectives: モデルの確信度と精度の整合性、および競合する目標(有益性 vs 無害性)がどのようにバランスされているかの調査。
  • OOD Detection: モデルが対処できないプロンプトを特定するための、Out-of-Distribution (OOD) 検知の使用。
  • Human Comparison: 品質とトーンをベンチマークするために、モデルの出力を人間のライターが作成したものと比較。
  • Prompt Testing: 一貫性と安全性をテストするために、最近の関連研究から派生したプロンプトを使用したモデルの評価。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch