vllm-project/speculators

A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM

What it solves

Speculators は、出力品質を損なうことなく大規模言語モデル (LLM) の推論を高速化するために設計されたライブラリです。これは、より大きな base model が提案されたトークンを検証する「draft models」(speculators) をトレーニングすることで実現されます。投機的デコード (speculative decoding) と呼ばれるこのプロセスは、base model がトークンを一つずつ生成するのではなく、一度のフォワードパスで複数のトークンを検証できるようにすることで、レイテンシを削減します。

How it works

このライブラリは、これらのドラフトモデルをトレーニングするためのエンドツーエンドのフレームワークを提供します。EAGLE-3、P-EAGLE (単一パスで複数のトークンを予測)、DFlash (anchored-block drafting を使用) など、いくつかの高度なアルゴリズムをサポートしています。また、vLLM を使用して verifier model から hidden states を抽出することでオフラインのトレーニングデータ生成を行ったり、リアルタイムの hidden extraction システムを介してオンライントレーニングを行ったりすることも可能です。トレーニングされたモデルは Hugging Face-compatible な形式で保存され、vLLM 推論サーバーに直接デプロイして本番環境で使用できます。

Who it’s for

本番環境での LLM サービングのレイテンシを最適化したい ML エンジニアや研究者、特に vLLM を推論エンジンとして使用している方を対象としています。

Highlights

  • Direct vLLM Integration: Speculators でトレーニングされたモデルは、vllm serve コマンドを使用してシームレスに提供できます。
  • Diverse Algorithm Support: EAGLE-3、P-EAGLE、DFlash、および Multi-Token Prediction (MTP) ファインチューニングをサポートしています。
  • Flexible Training: 必要な hidden states を生成するために、オフラインとオンラインの両方のトレーニングモードを提供します。
  • Broad Model Support: Llama, Qwen3, gpt-oss, および Gemma 4 と互換性があり、MoE や Vision Language モデルも含まれます。
  • Memory Efficiency: DFlash および DSpark speculators 用にスライディングウィンドウアテンションを実装し、長いシーケンスの KV cache 割り当てを削減します。