sgl-project/SpecForge
Train speculative decoding models effortlessly and port them smoothly to SGLang serving.
它解决的问题
SpecForge 的设计目的是解决缺乏维护良好且与 SGLang 兼容的推测解码模型训练框架的问题。它提供了一个统一、可直接运行的开箱即用生态系统,用于训练草稿模型,这些模型可以无缝移植到 SGLang 服务框架,以加速 LLM 推理速度。
它是如何工作的
SpecForge 使用单一的、带类型的训练入口点 (specforge train) 和配置文件来管理不同的训练拓扑。它支持多种草稿方法,包括基于特征的自回归草稿(EAGLE3、EAGLE3.1、P-EAGLE)和块并行草稿(DFlash、Domino、DSpark)。该框架支持本地离线训练、仅限服务器的在线分离训练,以及各种并行拓扑(数据、张量和序列并行)。
适用对象
想要训练自己的推测解码草稿模型并使用 SGLang 进行高性能推理部署的开发者和研究者。
特点
- SGLang 兼容性:直接与 SGLang 兼容,无需额外工作即可移植。
- 统一训练入口点:所有方法使用相同的命令行界面进行训练。
- 多样化的草稿方法:支持多种最先进的草稿技术,如 EAGLE3 和 DFlash。
- 灵活的训练拓扑:支持离线、在线和分离的训练工作流程。
- SpecBundle:提供一系列生产级草稿模型,接受率高,可直接使用。