thunlp/OPD
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
解决的问题
本项目针对大语言模型中在线策略蒸馏(OPD)的训练动态和失败模式缺乏理解的问题。系统性地探究OPD成功或失败的原因,并提供实用策略,在蒸馏失败时恢复性能。
工作原理
OPD通过教师模型提供的token级奖励信号来训练学生模型。本项目识别出两个关键成功条件:学生与教师必须具备兼容的思维模式,且教师必须提供学生尚未接触过的能力。
为改善失败的OPD,项目实现了两种具体策略:
- 离策略冷启动:通过初始化过程弥合模型间的差距。
- 教师对齐的提示选择:选择更有利于学生与教师能力对齐的提示。
技术上,使用 verl 框架进行强化学习和蒸馏,使用 LlamaFactory 进行监督微调(SFT),支持多种Top-K token选择和加权策略,以优化奖励信号。
适用人群
从事模型蒸馏、大语言模型后训练,以及希望优化从大教师模型向小学生模型知识迁移的研究人员和开发者。
主要亮点
- 机制分析:提供token级分析,表明成功的OPD依赖于学生访问状态下的高概率token对齐。
- 恢复策略:引入离策略冷启动和教师对齐提示选择,用于修复失败的蒸馏运行。
- 集成:将诊断指标(
overlap_ratio和overlap_token_advantage)合并到verl库中。 - 灵活配置:支持多种Top-K策略(并集、交集等)和奖励加权方案。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目