vllm-project/speculators
A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM
解決的問題
Speculators 解決了大語言模型(LLM)推論延遲高的問題。它提供了一個生產就緒的框架,用於訓練「草稿模型」(推測器),這些模型可以提前預測多個令牌,然後由更大的基礎模型一次性驗證。這在不改變最終輸出品質的前提下,減少主模型所需的昂貴前向傳播次數。
工作原理
該庫標準化了建立這些草稿模型的端對端流程。它允許使用者使用 vLLM 產生訓練資料(隱藏狀態),使用各種演算法訓練草稿模型,並直接將它們部署至 vLLM 推論伺服器中。它支援多種訓練架構,包括單層與多層模型,並與 MoE、非 MoE 以及視覺語言模型相容。
適用對象
專為希望在生產環境中透過推測解碼加速 LLM 部署的 AI 工程師與研究人員設計。
主要亮點
- 與 vLLM 直接整合: 使用 Speculators 訓練的模型可透過
vllm serve無縫部署。 - 支援多種演算法: 包括 EAGLE-3、DFlash、DSpark 和 P-EAGLE 訓練演算法。
- 支援多節點訓練: 透過
hs_connectors使用共享檔案系統或分散式儲存,在多個節點上進行線上訓練。 - 彈性模型支援: 相容多種架構,包括 Llama、Qwen、Gemma 和 NVIDIA Nemotron。
- MTP 微調: 支援在特定領域資料上對原生多令牌預測頭進行微調。
相關
- 專案
- Dispatch
- Dispatch
- 專案
- 專案