chrisliu298/awesome-on-policy-distillation
A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models
解決する課題
このプロジェクトは、オンポリシー蒸留(OPD) のためのキュレートされたリソースコレクションを提供します。これは、より大きな「教師」モデルを使用して、より小さな「生徒」大規模言語モデル(LLM)を訓練する技術です。従来の蒸留とは異なり、OPDは生徒が自身が生成したサンプル上で訓練されることで、「学習-推論分布ギャップ」を解消します。これにより、生徒は自身の誤りを修正する方法を学ぶことができます。
動作方法
OPDループでは、生徒モデルが軌道(ロールアウト)を生成します。その後、教師モデルがその特定の生徒生成サンプルに対して、密度の高いトークンレベルの監視またはスコアリングを提供します。このプロセスは以下の方法で実装できます:
- ホワイトボックス: 生徒は教師の内部確率分布(ログチット)にアクセスできます。
- ブラックボックス: 教師はAPI経由でアクセスされ、生徒は報酬や識別器から学習します。
- 自己蒸留: モデルが教師と生徒の両方の役割を果たし、しばしば特権的なコンテキストを使用して自己改善します。
対象読者
- AI研究者: モデル圧縮、知識蒸留、およびポストトレーニングの整合性に関する研究に従事する方。
- MLエンジニア: Qwen、DeepSeek、NVIDIAなどで使用されているような産業用蒸留レシピを実装し、効率的で高性能な小規模モデルを作成したい開発者。
- LLM実務家: モデルの学習方法と実際の推論時のパフォーマンスのギャップを縮小したい方。
主な特徴
- 包括的な分類体系: OPDループにおける役割(基盤、ギャップ補完、安定性など)に基づいて、数百の論文やレポートを整理しています。
- 産業用レシピ: Alibaba(Qwen3)、DeepSeek(V4)、NVIDIA(Nemotron-Cascade 2)などの主要ラボからの技術レポートを含みます。
- 実装ガイド: TRLの
DistillationTrainerなどのフレームワークやツールへのリンクで、トレーニングを加速します。 - 多様なモダリティ: OPDの拡張がエージェント、マルチモーダルモデル、音声、ロボット工学に及ぶことをカバーしています。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト