sgl-project/SpecForge

Train speculative decoding models effortlessly and port them smoothly to SGLang serving.

它解决了什么问题

SpecForge 解决了缺乏维护良好且兼容的推测解码模型训练框架的问题。它提供了一种标准化的方法来训练这些模型,使其能够无缝移植到 SGLang 服务框架中,从而加速大语言模型(LLM)的推理速度。

它如何工作

SpecForge 使用统一的、带类型的训练入口,允许用户通过 YAML 文件配置不同的草稿方法和部署拓扑。它支持多种训练模式,包括在线分离式训练以及共置和分离式离线训练。该框架支持多种数据、张量和序列并行拓扑,以优化训练过程。

适用于谁

专为希望训练推测解码草稿模型以提升其大语言模型(LLM)推理性能的开发者和研究人员设计,特别是那些使用 SGLang 服务框架的用户。

主要亮点

  • SGLang 兼容性:使用 SpecForge 训练的模型无需额外移植工作即可与 SGLang 配合使用。
  • 多种草稿方法支持:支持多种技术,包括 EAGLE3、P-EAGLE、DFlash、DFlash2、Domino 和 DSpark。
  • 灵活的训练拓扑:支持在线和离线训练,并提供共置或分离式设置选项。
  • SpecBundle:提供一系列可直接使用的生产级预训练推测解码模型集合。

一个为 SGLang 量身打造的训练框架,可显著加速大语言模型的推理速度 — @handle

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch