chrisliu298/awesome-on-policy-distillation

A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models

What it solves

本仓库针对「训练‑推理分布差距」(曝光偏差)提供解决方案。当大型语言模型 (LLM) 在固定数据集(离线策略)上训练,但在推理时必须自行生成文本时,会产生此差距。通过聚焦 on‑policy 蒸馏 (OPD),本仓库提供精选资源,帮助开发者和研究者在学生模型自行演化的输出上训练,同时从教师模型获得密集、逐 token 的指导。

How it works

On‑policy 蒸馏的流程是一个循环:学生模型根据当前策略生成轨迹(样本),随后教师模型——可能是外部的、具特权的,甚至是同一模型(自我蒸馏)——对这些学生生成的样本进行打分或提供监督。此过程确保学生能够纠正自己的错误,并使训练分布与实际推理行为保持一致。

Who it’s for

  • AI Researchers 研究训练后原语、策略梯度与知识蒸馏。
  • ML Engineers 为生产环境的 LLM 实现模型压缩或能力转移。
  • Developers 寻找阿里巴巴 (Qwen)、DeepSeek、NVIDIA 等实验室使用的工业配方。

Highlights

  • Comprehensive Taxonomy:依据反馈信号、教师访问模式(白盒 vs. 黑盒)和损失范围,组织数百篇论文和工具。
  • Industrial Recipes:收录主要实验室的技术报告(如 Qwen3、DeepSeek‑V4、GLM‑5),展示 OPD 在生产环境的应用。
  • Diverse Variants:涵盖自我蒸馏(无外部教师)、黑盒 OPD(仅 API 教师)与上下文内化(将提示蒸馏至权重)等专门技术。
  • Implementation Guides:提供框架与工程实现说明,包含 TRL 的 DistillationTrainer 以实现高速蒸馏。