chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

解決する課題

このプロジェクトは、オンポリシー蒸留(OPD) のためのキュレートされたリソースコレクションを提供します。これは、より大きな「教師」モデルを使用して、より小さな「生徒」大規模言語モデル(LLM)を訓練する技術です。従来の蒸留とは異なり、OPDは生徒が自身が生成したサンプル上で訓練されることで、「学習-推論分布ギャップ」を解消します。これにより、生徒は自身の誤りを修正する方法を学ぶことができます。

動作方法

OPDループでは、生徒モデルが軌道(ロールアウト)を生成します。その後、教師モデルがその特定の生徒生成サンプルに対して、密度の高いトークンレベルの監視またはスコアリングを提供します。このプロセスは以下の方法で実装できます:

  • ホワイトボックス: 生徒は教師の内部確率分布(ログチット)にアクセスできます。
  • ブラックボックス: 教師はAPI経由でアクセスされ、生徒は報酬や識別器から学習します。
  • 自己蒸留: モデルが教師と生徒の両方の役割を果たし、しばしば特権的なコンテキストを使用して自己改善します。

対象読者

  • AI研究者: モデル圧縮、知識蒸留、およびポストトレーニングの整合性に関する研究に従事する方。
  • MLエンジニア: Qwen、DeepSeek、NVIDIAなどで使用されているような産業用蒸留レシピを実装し、効率的で高性能な小規模モデルを作成したい開発者。
  • LLM実務家: モデルの学習方法と実際の推論時のパフォーマンスのギャップを縮小したい方。

主な特徴

  • 包括的な分類体系: OPDループにおける役割(基盤、ギャップ補完、安定性など)に基づいて、数百の論文やレポートを整理しています。
  • 産業用レシピ: Alibaba(Qwen3)、DeepSeek(V4)、NVIDIA(Nemotron-Cascade 2)などの主要ラボからの技術レポートを含みます。
  • 実装ガイド: TRLの DistillationTrainer などのフレームワークやツールへのリンクで、トレーニングを加速します。
  • 多様なモダリティ: OPDの拡張がエージェント、マルチモーダルモデル、音声、ロボット工学に及ぶことをカバーしています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト