vllm-project/speculators

A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM

解决的问题

Speculators 解决了大语言模型(LLM)推理延迟高的问题。它提供了一个生产就绪的框架,用于训练"草稿模型"(推测器),这些模型可以提前预测多个令牌,然后由更大的基础模型一次性验证。这在不改变最终输出质量的前提下,减少了主模型所需的昂贵前向传播次数。

工作原理

该库标准化了创建这些草稿模型的端到端流程。它允许用户使用 vLLM 生成训练数据(隐藏状态),使用各种算法训练草稿模型,并直接将它们部署到 vLLM 推理服务器中。它支持多种训练架构,包括单层和多层模型,并与 MoE、非 MoE 以及视觉语言模型兼容。

适用人群

专为希望在生产环境中通过推测解码加速 LLM 部署的 AI 工程师和研究人员设计。

主要亮点

  • 与 vLLM 直接集成: 使用 Speculators 训练的模型可无缝通过 vllm serve 部署。
  • 支持多种算法: 包括 EAGLE-3、DFlash、DSpark 和 P-EAGLE 训练算法。
  • 支持多节点训练: 通过 hs_connectors 使用共享文件系统或分布式存储,在多个节点上进行在线训练。
  • 灵活的模型支持: 兼容多种架构,包括 Llama、Qwen、Gemma 和 NVIDIA Nemotron。
  • MTP 微调: 支持在特定领域数据上对原生多令牌预测头进行微调。

相关

  • 项目
  • Dispatch
  • Dispatch
  • 项目
  • 项目