vllm-project/speculators

A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM

何を解決するか

Speculators は大規模言語モデル(LLM)の推論遅延の問題に対処します。本ライブラリは、"ドラフトモデル"(スペキュレーター)を訓練するためのプロダクション対応フレームワークを提供し、複数トークンを事前に予測できるようにします。その後、大きなベースモデルが1回のパスでその予測を検証します。これにより、メインモデルが実行する高コストなフォワードパスの回数を削減しつつ、最終的な出力品質を損なわずに行えます。

動作方法

このライブラリは、これらのドラフトモデルを作成するエンドツーエンドのプロセスを標準化しています。vLLM を使って訓練データ(隠れ状態)を生成し、さまざまなアルゴリズムでドラフトモデルを訓練し、vLLM 推論サーバーに直接デプロイできます。単層および多層モデルを含む複数の訓練アーキテクチャをサポートしており、MoE、非MoE、および視覚言語モデルとも互換性があります。

対象ユーザー

プロダクション環境でのLLMデプロイを高速化したいAIエンジニアや研究者向けに設計されています。

主な特徴

  • vLLM との直接統合: Speculators で訓練されたモデルは vllm serve を使ってシームレスにデプロイ可能です。
  • 多様なアルゴリズム対応: EAGLE-3、DFlash、DSpark、P-EAGLE などの訓練アルゴリズムをサポートしています。
  • マルチノード訓練: 共有ファイルシステムや分散ストアを介して hs_connectors を使って複数ノード間でオンライン訓練をサポートします。
  • 柔軟なモデル対応: Llama、Qwen、Gemma、NVIDIA Nemotron など幅広いアーキテクチャに対応しています。
  • MTP ファインチューニング: ドメイン固有のデータ上でネイティブな Multi-Token Prediction ヘッドのファインチューニングをサポートしています。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト