Thinking-Space/Rethinking-OPD
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
解决的问题
本项目研究大语言模型(LLMs)中在线策略蒸馏(OPD)的动力学和机制。解决了人们对OPD为何有时会失败缺乏理解的问题,并提供了在蒸馏未成功时恢复性能的实用策略。
工作原理
本项目分析蒸馏过程中学生模型与教师模型之间的相互作用。识别出两个关键成功条件:学生模型与教师模型必须具备兼容的思维模式,且教师模型必须提供学生模型在训练期间尚未遇到的能力。
为改进OPD,项目实现了以下方法:
- 离策略冷启动:一种用于初始化学生模型的策略。
- 教师对齐的提示选择:一种选择更符合教师优势的提示的方法。
- token级奖励信号:使用教师模型基于token概率提供密集奖励(采用多种Top-K选择和加权策略)。
适用对象
从事LLM后训练的研究人员和开发者,特别是那些使用蒸馏技术将大型、更强大教师模型的知识迁移到小型学生模型的人。
主要亮点
- 机制分析:证明成功的OPD依赖于学生模型访问的状态中高概率token的逐步对齐。
- 实用恢复:提供具体的配方(冷启动和提示选择)以修复失败的蒸馏运行。
- 集成诊断:已将诊断功能合并到
verl框架中,用于追踪重叠率和token优势。 - 灵活训练:支持多种Top-K策略(并集、交集等)和token奖励的加权方案。
相关
- 项目
- 项目
- 项目
- 项目