chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

What it solves

本倉庫針對「訓練‑推論分佈差距」(曝光偏差) 提供解決方案。當大型語言模型 (LLM) 於固定資料集(離線政策)上訓練,但在推論時必須自行產生文字時,會產生此差距。透過聚焦於 on‑policy 蒸餾 (OPD),本倉庫提供精選資源,協助開發者與研究者在學生模型自行演化的輸出上訓練,同時從教師模型取得密集、逐 token 的指導。

How it works

On‑policy 蒸餾的流程是一個迴圈:學生模型根據當前策略產生軌跡(樣本),接著教師模型——可能是外部的、具特權的,或甚至是同一模型(自我蒸餾)——對這些學生產生的樣本給予分數或監督。此過程確保學生能修正自己的錯誤,並使訓練分佈與實際推論行為保持一致。

Who it’s for

  • AI Researchers 研究訓練後原語、策略梯度與知識蒸餾。
  • ML Engineers 為生產環境的 LLM 實作模型壓縮或能力轉移。
  • Developers 尋找阿里巴巴 (Qwen)、DeepSeek、NVIDIA 等實驗室使用的工業配方。

Highlights

  • Comprehensive Taxonomy:依回饋訊號、教師存取模式(白盒 vs. 黑盒)與損失範圍,組織數百篇論文與工具。
  • Industrial Recipes:收錄主要實驗室的技術報告(如 Qwen3、DeepSeek‑V4、GLM‑5),展示 OPD 在生產環境的應用。
  • Diverse Variants:涵蓋自我蒸餾(無外部教師)、黑盒 OPD(僅 API 教師)與上下文內化(將提示蒸餾至權重)等專門技術。
  • Implementation Guides:提供框架與工程實作說明,包含 TRL 的 DistillationTrainer 以實現高速蒸餾。