apple-aiml-research/ml-diffucoder
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
解決する課題
DiffuCoderは、コード生成における自己回帰(AR)モデルの限界に対処し、マスク拡散モデル(dLLM)がコードをより柔軟かつ効率的に生成できる方法を探求します。また、新しいサンプリング手法を導入してすべてのトークンが学習信号を受け取れるようにすることで、dLLMのポストトレーニングにおける非効率性と高い分散にも取り組みます。
仕組み
DiffuCoderは、コード生成のためのマスク拡散モデルです。テキストを左から右に生成するARモデルとは異なり、拡散プロセスを使用してトークンを洗練します。パフォーマンスを向上させるために、このプロジェクトではCoupled-GRPOを導入します。これは、結合サンプリング方式を使用するポストトレーニング手法です。この方式は、すべてのターゲットトークンをカバーするタイムステップのペアを選択し、各トークンの対数確率が少なくとも1回計算されることを保証し、現実的な部分マスクコンテキストでより正確な確率推定を提供します。
対象読者
このプロジェクトは、非自己回帰生成、拡散ベースの言語モデル、および特殊なコード生成モデルに取り組むAI研究者と開発者を対象としています。
ハイライト
- Coupled-GRPO: 拡散LLMの分散を減らし、学習効率を向上させる新しいポストトレーニング手法。
- 非線形生成: 従来のARモデルの厳密な左から右へのバイアスを打破する能力。
- 自己回帰スコア: 生成プロセス中の因果パターンを定量化する新しいメトリック。
- 事前学習モデル: Hugging Faceで7BモデルのBase、Instruct、cpGRPOバージョンを利用可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト