chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

What it solves

このリポジトリは、固定データセット(オフポリシー)で学習した大規模言語モデル (LLM) が、推論時に独立してテキストを生成しなければならない際に生じる「訓練‑推論分布ギャップ」(エクスポージャーバイアス)に対処します。オンポリシー蒸留 (OPD) に焦点を当て、開発者や研究者が学生モデルの自己生成出力上で学習しつつ、教師モデルからトークンレベルの密な指導を受けられるよう、厳選されたリソースを提供します。

How it works

オンポリシー蒸留は、学生モデルが現在のポリシーで軌跡(サンプル)を生成し、教師モデル—外部の特権モデル、あるいは同一モデル(自己蒸留)でも可—がその学生生成サンプルに対してスコア付けや教師信号を与えるループです。このプロセスにより、学生は自らのミスを修正し、訓練分布を実際の推論挙動と合わせることができます。

Who it’s for

  • AI Researchers 訓練後プリミティブ、ポリシー勾配、知識蒸留を研究する方。
  • ML Engineers 本番環境の LLM 向けにモデル圧縮や能力転送を実装するエンジニア。
  • Developers Alibaba (Qwen)、DeepSeek、NVIDIA などのラボで使われている産業レシピを探している開発者。

Highlights

  • Comprehensive Taxonomy:フィードバック信号、教師アクセスモード(ホワイトボックス vs. ブラックボックス)、ロス範囲で数百件の論文とツールを整理。
  • Industrial Recipes:主要ラボの技術レポート(例:Qwen3、DeepSeek‑V4、GLM‑5)を収録し、OPD の実運用例を示す。
  • Diverse Variants:自己蒸留(外部教師なし)、ブラックボックス OPD(API のみ教師)、コンテキスト内部化(プロンプトを重みへ蒸留)など多様な手法を網羅。
  • Implementation Guides:フレームワークやエンジニアリングのハウツーへのリンクを提供。高速蒸留を実現する TRL の DistillationTrainer も含む。