Thinking-Space/Rethinking-OPD

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

何を解決するか

このプロジェクトは、大規模言語モデル(LLM)におけるオンポリシー蒸留(OPD)のダイナミクスとメカニズムを調査します。OPDがなぜ時折失敗するのかという理解の不足に取り組み、蒸留が成功しない場合に性能を回復するための実用的な戦略を提供します。

仕組み

このプロジェクトは、蒸留中に生徒モデルと教師モデルの相互作用を分析します。成功のための2つの重要な条件を特定しました:生徒モデルと教師モデルは互換性のある思考パターンを持つ必要があり、教師モデルは生徒モデルが訓練中にすでに経験していない能力を提供しなければなりません。

OPDを改善するために、以下の実装を行っています:

  • オフポリシー・コールドスタート:生徒モデルを初期化するための戦略。
  • 教師に合わせたプロンプト選択:教師の強みとより良い一致を実現するためのプロンプト選択方法。
  • トークンレベルの報酬信号:教師モデルを使って、トークン確率に基づく密集した報酬を提供(さまざまなTop-K選択および重み付け戦略を用いる)。

対象者

大規模言語モデルの後処理に取り組んでいる研究者や開発者。特に、より大きな能力を持つ教師モデルから、より小さな生徒モデルへ知識を転送するために蒸留を使用している人。

主な特徴

  • メカニズム分析:成功したOPDが、生徒モデルが訪れた状態における高確率トークンに対する段階的な整合性に依存することを証明。
  • 実用的な回復:失敗した蒸留実行を修正するための具体的なレシピ(コールドスタートとプロンプト選択)を提供。
  • 統合verlフレームワークに統合された診断機能を備え、重複率とトークンアドバンテージを追跡可能。
  • 柔軟な訓練:複数のTop-K戦略(和集合、共通部分など)およびトークン報酬の重み付けスキームをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト