chrisliu298/awesome-on-policy-distillation
A curated collection of papers, technical reports, frameworks, and tools for on-policy distillation (OPD) of large language models
解决的问题
本项目提供了一个针对 在线策略蒸馏(OPD) 的精选资源集合,这是一种利用更大规模的「教师」模型来训练更小的「学生」大语言模型(LLM)的技术。与传统蒸馏不同,OPD 通过让学生在自身生成的样本上进行训练,而非固定数据轨迹,从而解决「训练-推理分布差距」问题,确保学生模型能够学会纠正自身的错误。
如何工作
在 OPD 循环中,学生模型生成轨迹(rollouts)。随后,教师模型对这些特定的学生生成样本提供密集的、逐 token 的监督或评分。该过程可通过以下几种方式实现:
- 白盒: 学生模型可访问教师模型的内部概率分布(logits)。
- 黑盒: 教师模型通过 API 访问,学生模型从奖励或判别器中学习。
- 自蒸馏: 模型同时扮演教师和学生角色,通常利用特权上下文来提升自身性能。
适用人群
- AI 研究者: 关注模型压缩、知识蒸馏和后训练对齐的研究人员。
- ML 工程师: 希望实现工业级蒸馏方案(如 Qwen、DeepSeek 或 NVIDIA 所用方案)以构建高效、高性能小型模型的开发者。
- LLM 实践者: 任何希望缩小模型训练方式与实际推理表现之间差距的人。
亮点
- 全面的分类体系: 按照 OPD 循环中的角色(基础、填补差距、稳定性等)对数百篇论文和报告进行组织。
- 工业级方案: 包含来自阿里巴巴(Qwen3)、DeepSeek(V4)和 NVIDIA(Nemotron-Cascade 2)等主要实验室的技术报告。
- 实现指南: 提供 TRL 的
DistillationTrainer等框架和工具的链接,加速训练过程。 - 多模态扩展: 涵盖 OPD 在智能体、多模态模型、语音和机器人领域的延伸应用。
相关
- 项目
- 项目
- Dispatch
- 项目