sgl-project/SpecForge

Train speculative decoding models effortlessly and port them smoothly to SGLang serving.

解決的問題

SpecForge 解決了缺乏良好維護且相容的推測解碼模型訓練框架的問題。它提供了一種標準化的方式來訓練這些模型,使其能夠無縫移植到 SGLang 伺服框架中,從而加速 LLM 推理速度。

工作原理

SpecForge 使用統一的、類型化的訓練入口點,允許使用者透過 YAML 檔案配置不同的草稿方法和部署拓撲。它支援多種訓練模式,包括線上分散式訓練以及共置和分散式離線訓練。該框架支援多種資料、張量和序列平行拓撲,以優化訓練過程。

適用對象

專為希望訓練推測解碼草稿模型以提升其 LLM 推理效能的開發人員和研究人員設計,特別是那些使用 SGLang 伺服框架的使用者。

主要特色

  • SGLang 相容性:使用 SpecForge 訓練的模型無需額外移植工作即可與 SGLang 搭配使用。
  • 多種草稿方法:支援多種技術,包括 EAGLE3、P-EAGLE、DFlash、DFlash2、Domino 和 DSpark。
  • 彈性訓練拓撲:支援線上與離線訓練,並提供共置或分散式設定的選項。
  • SpecBundle:提供一組可立即使用的生產級預訓練推測解碼模型。

"SpecForge 讓我們能快速嘗試不同的推測解碼策略,並輕鬆地將模型部署到 SGLang。" — @specforge_dev

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch