vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング
vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング
vLLM と Speculators プロジェクトは、従来の自己回帰的スペキュラティブデコーディングのレイテンシボトルネックを克服するため、3 つの並列ドラフティング アルゴリズム—P-EAGLE、DFlash、DSpark—のオープンソース サポートを導入しました。単一のフォワードパスで候補トークンのブロック全体を予測することにより、これらの手法はドラフトレイテンシを推測トークンの数から切り離し、より表現力の高いスペキュレータ モデルの使用を可能にし、手動のパラメータ チューニングの必要性を減らします。
自己回帰ドラフティングの制限
従来のスペキュラティブデコーディング フレームワーク(EAGLE や MTP など)は、検証器モデルの内部隠れ状態を利用することでトークン受容率を向上させました。ただし、EAGLE-3 のような高度なイテレーションはまだ 自己回帰ドラフティング に依存しており、スペキュレータは生成される各トークンごとに別個のフォワードパスを実行する必要があります。
- モデルサイズの制約: 検証中に節約された時間をドラフトプロセスが消費しないようにするため、スペキュレータ モデルは極めて小さく軽量である必要があります。
- 運用の複雑さ: ドラフトコストはトークン数に対して線形にスケールするため、エンジニアリング チームは特定のユースケースとリアルタイムのサーバー負荷に基づいて、推測長さ (K) を常に調整する必要があります。
並列ドラフティング: アーキテクチャのシフト
並列ドラフティングは、単一のフォワードパスで候補トークンのブロックを同時に予測することにより、逐次実行を排除します。このシフトにより、主に 2 つの利点が得られます:
- 表現力の向上: スペキュレータはブロックごとに 1 回しか実行されないため、開発者はより大きく深いアーキテクチャを使用して、より複雑なコンテキストを捉え、レイテンシを増やさずに受容率を高めることができます。
- チューニングの簡素化: ドラフトコストをブロック長から切り離すことにより、変動するサーバー負荷時に推測パラメータのハイパーチューニングの運用負担が解消されます。
While earlier concepts like Medusa and PARD explored parallel drafting, P-EAGLE, DFlash, and DSpark combine this parallel execution with deep verifier-state conditioning.
P-EAGLE、DFlash、DSpark の技術的比較
これらの 3 つのアルゴリズムはすべて、検証器モデルの隠れ状態を利用して並列ドラフトを生成しますが、アーキテクチャの実装とトレーニング戦略において異なります。
P.EAGLE
P-EAGLE は、検証器モデルの隠れ状態を入力特徴として使用し、それらを複数の未来の位置に同時にマッピングして、1 ステップで候補トークンのシーケンスを出力します。トレーニング コストを管理するために、ドラフト ブロック スパースフィケーション を使用します。これは、ルックアヘッド次元 (K) 沿いのトークンを減衰率でドロップし、最も重要な直近のトークンに最適化を集中させます。
DFlash
DFlash は、検証器の隠れ状態を射影し、それをスペキュレータ モデルの KV キャッシュに直接注入します。これにより、入力シーケンス長を増やさずに、ブロック拡散を利用して候補トークンを生成しながら、スペキュレータの注意機構を検証器の状態に条件付けます。トレーニングでは、DFlash は シーケンス長 スパースフィケーション を使用し、GPU メモリを保存するために、シーケンス上のランダムなアンカー ポイントでのみブロック予測を計算します。
DSpark
DSpark は DFlash のバックボーンに基づいて構築され、以下の 2 つの追加機能があります:
- 自己回帰修正ヘッド: 過去のトークンに未来のトークンをより強く条件付けできる軽量なヘッドで、並列スループットとシーケンシャルな整合性を組み合わせます。
- 信頼度ヘッド: 検証器に到達する前にドラフト トークンにスコアを付けるメカニズムで、受け入れられる可能性が高いもののみを転送し、無駄な検証計算を削減してスループットを向上させます。
推論パフォーマンスとベンチマーク
並列ドラフティング アルゴリズムは、さまざまなモデルとタスクにおいて EAGLE-3 と比較して顕著なパフォーマンス向上を示します:
| モデル | アルゴリズム | ユースケース | ハードウェア |
|---|---|---|---|
| Qwen3-8B | P-EAGLE | Math reasoning (GSM8k) | 1xA100 |
| Qwen3-30B-A3B | DFlash | Coding (HumanEval) | 2xA100 |
| gemma-4-31B-it | DSpark | Coding (HumanEval) | 2xA100 |
vLLM との本番環境統合
並列ドラフティングは、Speculators リポジトリを介して vLLM に統合されています。このエコシステムは、これらのモデルのトレーニングと評価のための統一されたフレームワークを提供します。ユーザーは、vLLM の初期化時に speculative-config フラグでモデルとメソッドを指定することにより、並列バックエンドのスペキュラティブ エンジンを起動できます:
vllm serve Qwen/Qwen3-30B-A3B \
--tensor-parallel-size 2 \
--reasoning-parser qwen3 \
--speculative-config '{
"model": "RedHatAI/Qwen3-30B-A3B-speculator.dflash",
"num_speculative_tokens": 7,
"method": "dflash"
}'
Because speculative decoding uses rejection sampling to preserve the verifier model's output distribution, the final output quality remains mathematically identical to standard decoding.
SUMMARY: vLLM と Speculators プロジェクトは、P-EAGLE、DFlash、DSpark のオープンソース サポートを導入し、自己回帰ドラフティングを超えて並列で候補トークン ブロックを生成し、LLM の推論を高速化します。
TITLE: vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング