DiffusionGemma: テキスト拡散による4倍高速テキスト生成
DiffusionGemma: テキスト拡散による4倍高速テキスト生成
Google DeepMindは、高速テキスト生成のために設計された実験的なオープンモデルであるDiffusionGemmaを発表しました。トークンを順番に処理する代わりに、テキスト拡散アプローチを使用してテキストブロック全体を同時に生成することで、専用GPU上で最大4倍高速な推論を実現します。
高速推論とハードウェア最適化
DiffusionGemmaは、デコーディングのボトルネックをメモリ帯域幅から計算にシフトし、ローカルかつ低同時実行の推論においてGPUハードウェアをより効率的に活用できるようにします。このアプローチにより、従来の自己回帰モデルと比較してトークン出力速度が大幅に向上します。
- パフォーマンスベンチマーク: このモデルは、単一のNVIDIA H100で1秒あたり1000+トークン、NVIDIA GeForce RTX 5090で1秒あたり700+トークンを達成できます。
- ハードウェアフットプリント: 推論時にのみ3.8Bパラメータをアクティベートする26B Mixture of Experts (MoE)モデルであるため、量子化するとDiffusionGemmaはハイエンドコンシューマGPUの18GB VRAM制限内に収まります。
- エンタープライズおよびコンシューマサポート: このモデルは、NVIDIAハードウェアに最適化されており、HopperおよびBlackwellアーキテクチャでNVFP4(4ビット浮動小数点)カーネルを使用し、ほぼ無損失の精度でスループットを向上させます。また、RTX 4090やRTX 5090などのコンシューマGPUと互換性があります。
テクニカルアーキテクチャ: テキスト拡散 対 自己回帰生成
DiffusionGemmaは、左から右へ1トークンずつ生成する標準的な「タイプライター」方式から脱却しています。代わりに、「印刷機」のように機能し、256トークンの段落全体を同時に下書きします。
拡散プロセス
画像生成モデルと同様に、DiffusionGemmaは反復的な改良プロセスを通じてテキストを生成します:
- キャンバス: プロセスはランダムなプレースホルダートークンのキャンバスから始まります。
- 反復的改良: モデルは複数回のパスを実行し、正しいトークンを固定してそれらをコンテキストとして使用し、残りのプレースホルダーを改良します。
- 最終仕上げ: テキストは高品質な最終出力に収束します。
双方向注意と非線形生成
モデルが256トークンを並列で生成するため、各トークンは他のすべてのトークンに注意を向けることができます。この双方向注意は、トークンが将来のコンテキストに依存する非線形タスクにおいて明確な利点を提供します。例えば:
- インライン編集とコードのインフィリング。
- アミノ酸配列または数学的グラフの生成。
- 数独パズルの解決(自己回帰モデルが通常苦手とするタスク)。
ユースケースと本番運用のトレードオフ
DiffusionGemmaは極端な速度を提供しますが、出力品質とデプロイ環境に関して特定のトレードオフがあります。
品質 対 速度
DiffusionGemmaは、最大の出力品質よりも速度と並列レイアウト生成を優先します。最高可能な品質が必要なアプリケーションについては、Google DeepMindは標準のGemma 4モデルを推奨します。
ローカル 対 クラウドデプロイ
DiffusionGemmaは、ローカルおよび低同時実行の推論に特化して最適化されています。高QPS(1秒あたりのクエリ数)クラウド環境では、自己回帰モデルは数千のリクエストをバッチ処理して計算を飽和させることができるため、より効率的です。そのようなシナリオでは、DiffusionGemmaの並列デコードは収益逓減となり、サービスコストが増加する可能性があります。
可用性と統合
DiffusionGemmaはApache 2.0ライセンスの下でリリースされ、Hugging Faceを通じて利用可能です。いくつかの開発ツールとフレームワークでサポートされており、以下を含みます:
- サービングフレームワーク: MLX, vLLM (Red Hat統合あり), および Hugging Face Transformers.
- ファインチューニングツール: Hackable Diffusion (JAXツールボックス), Unsloth, および NVIDIA NeMo.
- デプロイプラットフォーム: Gemini Enterprise Agent Platform Model Garden および NVIDIA NIM.