vllm-project/speculators

A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM

What it solves

Speculators 是一个旨在不损失输出质量的情况下加速大语言模型 (LLM) 推理的库。它通过训练 "draft models" (speculators) 来实现这一点,这些草稿模型会提出 token,然后由较大的 base model 进行验证。这个过程被称为投机解码 (speculative decoding),通过允许 base model 在单次前向传播中验证多个 token,从而降低了延迟。

How it works

该库提供了一个端到端的框架来训练这些 draft models。它支持多种先进算法,包括 EAGLE-3, P-EAGLE (可在单次传递中预测多个 token) 以及 DFlash (使用 anchored-block drafting)。它还允许通过使用 vLLM 从 verifier model 提取 hidden states 进行离线训练数据生成,或者通过实时 hidden extraction 系统进行在线训练。训练好的模型以 Hugging Face-compatible 格式保存,并可以直接部署到 vLLM 推理服务器中用于生产环境。

Who it’s for

希望在生产环境中优化 LLM 服务延迟的 ML 工程师和研究人员,特别是那些使用 vLLM 作为其推理引擎的用户。

Highlights

  • Direct vLLM Integration: 使用 Speculators 训练的模型可以通过 vllm serve 命令无缝提供服务。
  • Diverse Algorithm Support: 支持 EAGLE-3, P-EAGLE, DFlash, 以及 Multi-Token Prediction (MTP) 微调。
  • Flexible Training: 提供离线和在线训练模式,用于生成必要的 hidden states。
  • Broad Model Support: 兼容 Llama, Qwen3, gpt-oss, 和 Gemma 4,包括 MoE 和 Vision Language 模型。
  • Memory Efficiency: 为 DFlash 和 DSpark speculators 实现了滑动窗口注意力机制,以减少长序列的 KV cache 分配。"} ,