DiffusionGemma 技術レポート

DiffusionGemma は、従来の自己回帰(AR)モデルの逐次デコードのボトルネックを解消するために設計された、実験的なオープンウェイト言語モデルです。256トークンのブロックを離散拡散(discrete diffusion)を用いて並列に反復的に洗練させることで、DiffusionGemma は単一の NVIDIA H100 GPU 上で毎秒約 1,500 出力トークンの生成速度を実現し、最先端の投機的デコード(speculative decoding)をも大幅に上回ります。

アーキテクチャとトレーニング・パイプライン

DiffusionGemma はゼロからトレーニングされているわけではありません。その代わりに、3.8B の活性化パラメータと 25.2B の総パラメータを備えた混合エキスパート(MoE)Gemma 4 モデルから派生しています。デコーダーのみの AR モデルからデノイザー(denoiser)への変換は、すべてのトークンのロジットを活用することで実現されます。これは、既存の AR モデルも備えている能力ですが、標準的な生成プロセスでは通常使用されません。

トレーニング・プロセスは、元の AR モデルの総トレーニング・トークン予算の 10% 未満で済む、計算効率の高い 2 段階のパイプラインを使用します:

  1. Supervised Fine-Tuning (SFT): 第 1 段階では、モデルに双方向のデノイジングを学習させます。

  2. Reinforcement Learning (RL) and Sampler Distillation: 第 2 段階では、RL とサンプラー蒸留(sampler distillation)を組み合わせて、生成品質と推論効率の両方を同時に向上させます。

パフォーマンスと機能

DiffusionGemma は、生成速度とモデル能力のトレードオフにおける新たなパレートの境界(Pareto frontier)を達成しました。平均して、1 回のフォワードパスで約 20 トークンを生成し、H100 GPU 上で毎秒 1,500 トークンのスループットを実現します。

拡散ベースのデコードへの移行にもかかわらず、モデルはベースとなる Gemma 4 モデルの重要な機能を保持しています:

  • Thinking mode: 内部的な推論プロセスをサポートします。
  • Multimodal inputs: 多様な入力タイプを処理する能力があります。
  • Longe contexts: 拡張されたコンテキスト・ウィンドウをサポートします。

さらに、モデルはわずかな性能低下のみで自己回帰(AR)生成も可能であり、これはハイブリッドな拡散-AR デコード・システムへの潜在的な道筋を示唆しています。

コミュニティの洞察と実装

コミュニティの議論では、この手法が他のオープンウェイト・モデルに適用され、既存のローカル LLM の高速な拡散バージョンを作成できる可能性が強調されています。

ハードウェアの最適化

ローカル・ハードウェアにモデルを実装しているユーザーは、Apple Silicon 上での成功を報告しています。ある開発者は、拡散デコードはメモリ帯域幅の制限ではなく計算量に依存するため、計算能力は高いがメモリ帯域幅が限られているデバイスに特に適していると指摘しています。

"I've got it up to ~15tok/s on M3-class machines... DiffusionGemma with the right drafter can hit 20-30 tok/s on my machine."

ソフトウェア開発への影響

一部のアナリストは、もし拡散モデルがコーディングにおいて高い習熟度に達した場合、極端な生成速度(1,500 tokens/sec)により、ソフトウェア開発のボトルネックがモデル生成から CPU の実行時間へと移行すると示唆しています。これは、コンパイラ、テスト・スイート・ランナー、および開発スタックが、LLM による提案と並行してコンパイルとユニットテストを並列に行うように設計される方法の再考をうつかがねないでしょう。

汎用化の可能性

コミュニティでは、この手法が Qwen などの他のモデルに適用され、コンシューマー級の GPU を持つユーザーのローカル推論速度を劇的に向上させられるかどうかに、大きな関心が集まっています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch