sgl-project/SpecForge
Train speculative decoding models effortlessly and port them smoothly to SGLang serving.
它解決的問題
SpecForge 的設計目的是解決缺乏維護良好且與 SGLang 相容的推測解碼模型訓練框架的問題。它提供了一個統一、可直接運行的開箱即用生態系統,用於訓練草稿模型,這些模型可以無縫移植到 SGLang 服務框架,以加速 LLM 推理速度。
它是如何運作的
SpecForge 使用單一的、帶類型的訓練入口點 (specforge train) 和配置文件來管理不同的訓練拓撲。它支援多種草稿方法,包括基於特徵的自回歸草稿(EAGLE3、EAGLE3.1、P-EAGLE)和區塊並行草稿(DFlash、Domino、DSpark)。該框架支援本地離線訓練、僅限伺服器的線上分離訓練,以及各種並行拓撲(數據、張量和序列並行)。
適合對象
想要訓練自己的推測解碼草稿模型並使用 SGLang 進行高性能推理部署的開發者和研究者。
特點
- SGLang 相容性:直接與 SGLang 相容,無需額外工作即可移植。
- 統一訓練入口點:所有方法使用相同的命令列介面進行訓練。
- 多樣化的草稿方法:支援多種最先進的草稿技術,如 EAGLE3 和 DFlash。
- 靈活的訓練拓撲:支援離線、線上和分離的訓練工作流程。
- SpecBundle:提供一系列生產級草稿模型,接受率高,可直接使用。