dllm-reasoning/d1

Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"

何を解決するか

事前学習された拡散型大規模言語モデル(dLLMs)における複雑な推論タスクのスケーリング課題に対処します。通常、標準的な自己回帰モデルと比較して、dLLMsは複雑な推論タスクで苦戦します。

動作方法

2段階アプローチを実装しています:

  1. マスク付き SFT:モデルの初期化に、完了のみのマスク付き教師あり微調整(SFT)を使用します。
  2. diffu-GRPO:マスク付き dLLMsに特化した、グループ相対的ポリシー最適化(GRPO)に基づく新しい方策勾配法。効率的な対数確率推定を特徴とし、推論のスケーリングに強化学習(RL)を可能にします。

対象ユーザー

拡散型言語モデルの研究・開発に従事している研究者や開発者、および非自己回帰型LLMの推論性能を強化学習で向上させたいと考えている人。

特徴

  • 新規強化学習手法:拡散型LLMにおける効率的な方策勾配更新のための diffu-GRPO を導入。
  • 2段階パイプライン:マスク付き SFT と RL を組み合わせて推論をスケーリング。
  • 完全なツールキット:SFT、RLトレーニング、評価スクリプトの実装を提供。
  • 統合性:トレーニングおよびデータ収集に Transformers に似たインターフェースを採用。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト