vllm-project/speculators
A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM
何を解決するか
Speculators は大規模言語モデル(LLM)の推論遅延の問題に対処します。本ライブラリは、"ドラフトモデル"(スペキュレーター)を訓練するためのプロダクション対応フレームワークを提供し、複数トークンを事前に予測できるようにします。その後、大きなベースモデルが1回のパスでその予測を検証します。これにより、メインモデルが実行する高コストなフォワードパスの回数を削減しつつ、最終的な出力品質を損なわずに行えます。
動作方法
このライブラリは、これらのドラフトモデルを作成するエンドツーエンドのプロセスを標準化しています。vLLM を使って訓練データ(隠れ状態)を生成し、さまざまなアルゴリズムでドラフトモデルを訓練し、vLLM 推論サーバーに直接デプロイできます。単層および多層モデルを含む複数の訓練アーキテクチャをサポートしており、MoE、非MoE、および視覚言語モデルとも互換性があります。
対象ユーザー
プロダクション環境でのLLMデプロイを高速化したいAIエンジニアや研究者向けに設計されています。
主な特徴
- vLLM との直接統合: Speculators で訓練されたモデルは
vllm serveを使ってシームレスにデプロイ可能です。 - 多様なアルゴリズム対応: EAGLE-3、DFlash、DSpark、P-EAGLE などの訓練アルゴリズムをサポートしています。
- マルチノード訓練: 共有ファイルシステムや分散ストアを介して
hs_connectorsを使って複数ノード間でオンライン訓練をサポートします。 - 柔軟なモデル対応: Llama、Qwen、Gemma、NVIDIA Nemotron など幅広いアーキテクチャに対応しています。
- MTP ファインチューニング: ドメイン固有のデータ上でネイティブな Multi-Token Prediction ヘッドのファインチューニングをサポートしています。
関連
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト