dllm-reasoning/d1
Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"
何を解決するか
事前学習された拡散型大規模言語モデル(dLLMs)における複雑な推論タスクのスケーリング課題に対処します。通常、標準的な自己回帰モデルと比較して、dLLMsは複雑な推論タスクで苦戦します。
動作方法
2段階アプローチを実装しています:
- マスク付き SFT:モデルの初期化に、完了のみのマスク付き教師あり微調整(SFT)を使用します。
- diffu-GRPO:マスク付き dLLMsに特化した、グループ相対的ポリシー最適化(GRPO)に基づく新しい方策勾配法。効率的な対数確率推定を特徴とし、推論のスケーリングに強化学習(RL)を可能にします。
対象ユーザー
拡散型言語モデルの研究・開発に従事している研究者や開発者、および非自己回帰型LLMの推論性能を強化学習で向上させたいと考えている人。
特徴
- 新規強化学習手法:拡散型LLMにおける効率的な方策勾配更新のための diffu-GRPO を導入。
- 2段階パイプライン:マスク付き SFT と RL を組み合わせて推論をスケーリング。
- 完全なツールキット:SFT、RLトレーニング、評価スクリプトの実装を提供。
- 統合性:トレーニングおよびデータ収集に Transformers に似たインターフェースを採用。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト