dllm-reasoning/d1

Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"

解决的问题

解决预训练扩散型大语言模型(dLLMs)在复杂推理任务中难以扩展推理能力的问题,这类模型通常在复杂推理任务上表现不如标准自回归模型。

工作原理

该项目采用两阶段方法:

  1. 掩码SFT:使用仅完成的掩码监督微调(SFT)来初始化模型。
  2. diffu-GRPO:一种基于组相对策略优化(GRPO)的新型策略梯度方法,专为掩码dLLMs设计。该方法具有高效的对数概率估计,使推理扩展的强化学习(RL)成为可能。

适用人群

从事基于扩散的语言模型研究与开发的研究人员和开发者,以及希望利用强化学习提升非自回归LLM推理性能的人。

亮点

  • 新颖的强化学习方法:引入diffu-GRPO,实现扩散型LLM中高效的策略梯度更新。
  • 两阶段流水线:结合掩码SFT与强化学习,实现推理能力扩展。
  • 完整工具链:提供SFT、强化学习训练和评估脚本的完整实现。
  • 集成性:采用类似Transformers的接口,支持训练和数据整理。

相关

  • 项目
  • 项目
  • 项目
  • 项目