Thinking-Space/Rethinking-OPD

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

解决的问题

本项目研究大语言模型(LLMs)中在线策略蒸馏(OPD)的动力学和机制。解决了人们对OPD为何有时会失败缺乏理解的问题,并提供了在蒸馏未成功时恢复性能的实用策略。

工作原理

本项目分析蒸馏过程中学生模型与教师模型之间的相互作用。识别出两个关键成功条件:学生模型与教师模型必须具备兼容的思维模式,且教师模型必须提供学生模型在训练期间尚未遇到的能力。

为改进OPD,项目实现了以下方法:

  • 离策略冷启动:一种用于初始化学生模型的策略。
  • 教师对齐的提示选择:一种选择更符合教师优势的提示的方法。
  • token级奖励信号:使用教师模型基于token概率提供密集奖励(采用多种Top-K选择和加权策略)。

适用对象

从事LLM后训练的研究人员和开发者,特别是那些使用蒸馏技术将大型、更强大教师模型的知识迁移到小型学生模型的人。

主要亮点

  • 机制分析:证明成功的OPD依赖于学生模型访问的状态中高概率token的逐步对齐。
  • 实用恢复:提供具体的配方(冷启动和提示选择)以修复失败的蒸馏运行。
  • 集成诊断:已将诊断功能合并到 verl 框架中,用于追踪重叠率和token优势。
  • 灵活训练:支持多种Top-K策略(并集、交集等)和token奖励的加权方案。

相关

  • 项目
  • 项目
  • 项目
  • 项目