vllm-project/speculators

A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM

What it solves

Speculators 是一个设计用于在不损失输出质量的情况下加速大语言模型 (LLM) 推论的函式库。它通过训练 "draft models" (speculators) 来实现这一目标,这些草稿模型会提出建议的 token,然后由较大的 base model 验证。这个过程,被称为投机解码 (speculative decoding),通过允许 base model 在单次前向传播中验证多个 token,从而降低了延遲。

How it works

该函式库提供了一个端到端的框架来训练这些 draft models。它支持多种先进的算法,包括 EAGLE-3, P-EAGLE (ซึ่ง which predicts multiple tokens in a single pass), 和 DFlash (which uses anchored-block drafting)。它还允许通过使用 vLLM 从 verifier model 提取 hidden states,进行离线训练数据生成,或通过实时 hidden extraction 系统进行在线训练。训练好的模型会以 Hugging Face-compatible 格式保存,并可以直接部署到 vLLM 推论服务器中进行生产环境使用。

Who it’s for

想要在生产环境中优化 LLM 推论延遲的 ML 工程师和研究人员,特别是那些使用 vLLM 作为其推论引擎的开发者。

Highlights

  • Direct vLLM Integration: Speculators 训练的模型可以无缝缝衔接使用 vllm serve 命令进行提供服务。

  • Diverse Algorithm Support: 支持 EAGLE-

    hought: {