dllm-reasoning/d1
Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"
解决的问题
解决预训练扩散型大语言模型(dLLMs)在复杂推理任务中难以扩展推理能力的问题,这类模型通常在复杂推理任务上表现不如标准自回归模型。
工作原理
该项目采用两阶段方法:
- 掩码SFT:使用仅完成的掩码监督微调(SFT)来初始化模型。
- diffu-GRPO:一种基于组相对策略优化(GRPO)的新型策略梯度方法,专为掩码dLLMs设计。该方法具有高效的对数概率估计,使推理扩展的强化学习(RL)成为可能。
适用人群
从事基于扩散的语言模型研究与开发的研究人员和开发者,以及希望利用强化学习提升非自回归LLM推理性能的人。
亮点
- 新颖的强化学习方法:引入diffu-GRPO,实现扩散型LLM中高效的策略梯度更新。
- 两阶段流水线:结合掩码SFT与强化学习,实现推理能力扩展。
- 完整工具链:提供SFT、强化学习训练和评估脚本的完整实现。
- 集成性:采用类似Transformers的接口,支持训练和数据整理。
相关
- 项目
- 项目
- 项目
- 项目