sgl-project/SpecForge
Train speculative decoding models effortlessly and port them smoothly to SGLang serving.
它解决了什么问题
SpecForge 解决了缺乏维护良好且兼容的推测解码模型训练框架的问题。它提供了一种标准化的方法来训练这些模型,使其能够无缝移植到 SGLang 服务框架中,从而加速大语言模型(LLM)的推理速度。
它如何工作
SpecForge 使用统一的、带类型的训练入口,允许用户通过 YAML 文件配置不同的草稿方法和部署拓扑。它支持多种训练模式,包括在线分离式训练以及共置和分离式离线训练。该框架支持多种数据、张量和序列并行拓扑,以优化训练过程。
适用于谁
专为希望训练推测解码草稿模型以提升其大语言模型(LLM)推理性能的开发者和研究人员设计,特别是那些使用 SGLang 服务框架的用户。
主要亮点
- SGLang 兼容性:使用 SpecForge 训练的模型无需额外移植工作即可与 SGLang 配合使用。
- 多种草稿方法支持:支持多种技术,包括 EAGLE3、P-EAGLE、DFlash、DFlash2、Domino 和 DSpark。
- 灵活的训练拓扑:支持在线和离线训练,并提供共置或分离式设置选项。
- SpecBundle:提供一系列可直接使用的生产级预训练推测解码模型集合。
一个为 SGLang 量身打造的训练框架,可显著加速大语言模型的推理速度 — @handle
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch