人間のフィードバックからの強化学習 (RLHF) の解説

人間のフィードバックからの強化学習 (RLHF) は、人間の好みに基づいてモデルを直接最適化するために強化学習を使用することで、大規模言語モデル (LLM) を人間の価値観に合わせるために使用される手法です。このプロセスにより、モデルは単なる次のトークンの予測を超えて、より役立ち、真実味があり、かつ安全なテキストを生成できるようになります。

RLHF の 3 ステップのトレーニングプロセス

RLHF は、汎用的な事前学習済みモデルを、調整されたアシスタントへと変換する多段階のトレーニングパイプラインです。プロセスは 3 つのコアステップに分解されます。

1. 言語モデルの事前学習

プロセスは、次のトークンの予測に対する cross-entropy loss のような古典的な目的関数を使用して事前学習された言語モデルから始まります。初期モデルは、人間が生成した「好ましい」テキスト (OpenAI) や、「役に立つ、正直で、無害である」基準のための蒸留されたコンテキストの手がかり (Anthropic) などの拡張データで微調整できますが、核心となる要件は、多様な指示にうまく応答できるモデルであることです。

2. 報酬モデルのトレーニング

「良い」テキストの数学的な損失関数を定義することは困難であるため、RLHF は報酬モデル (RM) を使用して、人間の好みを数値的に表現します。

  • 目的: RM はテキストのシーケンスを受け取り、スカラー報酬を返します。
  • データ収集: プロンプトはデータセットからサンプリングされ、初期 LM に渡されて複数の出力を生成します。その後、人間のアノテーターがこれらの出力をランク付けします。
  • スコアリングではなくランキング: 人間は、絶対的なスカラー値のスコアを提供するのではなく、ヘッド・トゥ・ヘッドの対戦形式 (多くの場合 Elo システムを使用) で出力をランク付けします。ランキングはノイズが少なく、異なるアノテーター間でもより較正されています。
  • モデルの容量: 報酬モデルのサイズはさまざまです。例えば、 OpenAI は 175B の LM に対して 6B の報酬モデルを使用しましたが、DeepMind は LM と報酬モデルの両方に 70B Chinchilla モデルを使用しました。

3. 強化学習による微調整

最終段階では、ポリシー・グラディエント RL アルゴリズム、通常は Proximal Policy Optimization (PPO) を使用して、報酬モデルのスコアに基づいて初期 LM のコピーを最適化します。

  • RL の定式化:
    • Policy: プロンプトを受け取り、テキストのシーケンスを返す LM。
    • Action Space: 言語モデルの語彙 (通常は約 50k トークン)。
    • Observation Space: 可能な入力トークンシーケンスの分布。
    • Reward Function: 好みモデルからのスカラー報酬 ($r_{\theta}$) と、RL ポリシーと初期の事前学習済みモデルとの間の Kullback–Leibler (KL) ダイバージェンス ($r_{\text{KL}}$) に基づくペナルティの組み合わせ。
  • KL ペナルティ: KL ダイバージェンスの項は、モデルが元の事前学習済みモデルから離れすぎないようにします。このペナルティがなければ、モデルは報酬モデルを「騙して」高いスコアを与えるような、意味不明なテキストを生成する可能性があります。
  • Update Rule: PPO は、勾配更新が学習プロセスを不安定にさせないようにするための信頼領域最適化アルゴリズムとして使用されます。

RLHF 用のオープンソースツール

いくつかの PyTorch ベースのレポジトリが、RLHF を実装するために必要なインフラストラクチャを提供しています。

  • TRL (Transformers Reinforcement Learning): Hugging Face エコシステムにおいて、PPO を使用して事前学習済み LM を微調整するために設計されています。
  • TRLX: CarperAI によって構築された TRL の拡張フォークであり、より大きなモデル (最大 33B パラメータ、将来的に 200B をサポート) を扱い、オンラインおよびオフラインのトレーニングをサポートし、PPO および Implicit Language Q-Learning (ILQL) をサポートします。
  • RL4LMs: AllenAI によるライブラリであり、様々な RL アルゴリズム (PPO, NLPO, A2C, TRPO) と報酬関数を提供し、2,000 件の実験を通じてベンチマークされています。

現在の限界と将来の方向性

ChatGPT のようなモデルでの成功にもかかわらず、RLHF はいくつかのシステム的な課題に課題に直面しています。

  • データコストと品質: 人間の好みを反映したデータの収集は高価です。高品質な人間生成テキストには専門的なスタッフが必要であり、また、人間のアノテーターはしばしば意見が分かれるため、トレーニングデータに分散が生じます。
  • モデルの不完全性: RLHF で微調整されたモデルは、不確実性を表現せずに、有害なテキストや事実に基づかない不正確な正確なテキストを生成することがあります。
  • 最適化の機会: PPO は古いアルゴリズムであり、まだ探索の余地が大きく残されています。トレーニング中に報酬モデルの報酬のフォワード・パスを回避するために、オフライン RL (مثل ILQL) のような手法を用い、探索と利用のバランスを異なる方法で探ることが可能です。

Sources