chrisliu298/awesome-on-policy-distillation
A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models
What it solves
本仓库针对「训练‑推理分布差距」(曝光偏差)提供解决方案。当大型语言模型 (LLM) 在固定数据集(离线策略)上训练,但在推理时必须自行生成文本时,会产生此差距。通过聚焦 on‑policy 蒸馏 (OPD),本仓库提供精选资源,帮助开发者和研究者在学生模型自行演化的输出上训练,同时从教师模型获得密集、逐 token 的指导。
How it works
On‑policy 蒸馏的流程是一个循环:学生模型根据当前策略生成轨迹(样本),随后教师模型——可能是外部的、具特权的,甚至是同一模型(自我蒸馏)——对这些学生生成的样本进行打分或提供监督。此过程确保学生能够纠正自己的错误,并使训练分布与实际推理行为保持一致。
Who it’s for
- AI Researchers 研究训练后原语、策略梯度与知识蒸馏。
- ML Engineers 为生产环境的 LLM 实现模型压缩或能力转移。
- Developers 寻找阿里巴巴 (Qwen)、DeepSeek、NVIDIA 等实验室使用的工业配方。
Highlights
- Comprehensive Taxonomy:依据反馈信号、教师访问模式(白盒 vs. 黑盒)和损失范围,组织数百篇论文和工具。
- Industrial Recipes:收录主要实验室的技术报告(如 Qwen3、DeepSeek‑V4、GLM‑5),展示 OPD 在生产环境的应用。
- Diverse Variants:涵盖自我蒸馏(无外部教师)、黑盒 OPD(仅 API 教师)与上下文内化(将提示蒸馏至权重)等专门技术。
- Implementation Guides:提供框架与工程实现说明,包含 TRL 的
DistillationTrainer以实现高速蒸馏。