dllm-reasoning/d1

Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"

解決的問題

解決預訓練擴散型大語言模型(dLLMs)在複雜推理任務中難以擴展推理能力的問題,此類模型通常在複雜推理任務上的表現不如標準自回歸模型。

工作原理

本專案採用兩階段方法:

  1. 掩碼SFT:使用僅完成的掩碼監督微調(SFT)來初始化模型。
  2. diffu-GRPO:一種基於群組相對策略優化(GRPO)的新型策略梯度方法,專為掩碼dLLMs設計。該方法具備高效的對數機率估計,使推理擴展的強化學習(RL)成為可能。

適用對象

從事基於擴散語言模型研究與開發的研究人員與開發者,以及希望利用強化學習提升非自回歸LLM推理性能的人。

亮點

  • 新穎的強化學習方法:引入diffu-GRPO,實現擴散型LLM中高效的策略梯度更新。
  • 兩階段流程:結合掩碼SFT與強化學習,實現推理能力擴展。
  • 完整工具鏈:提供SFT、強化學習訓練與評估腳本的完整實作。
  • 整合性:採用類似Transformers的介面,支援訓練與資料整理。

相關

  • 專案
  • 專案
  • 專案
  • 專案