sgl-project/SpecForge

Train speculative decoding models effortlessly and port them smoothly to SGLang serving.

何を解決するか

SpecForge は、メンテナンスが行き届いており SGLang と互換性のある推測デコード モデルのトレーニング フレームワークが不足している問題に対処するように設計されています。統合され、すぐに実行できるオフザシェルフ エコシステムを提供し、SGLang サービング フレームワークにシームレスに移植できるドラフト モデルをトレーニングして、LLM の推論速度を向上させます。

どうやって動作するか

SpecForge は、単一のタイプ付きトレーニング エントリ ポイント (specforge train) と構成ファイルを使用して、さまざまなトレーニング トポロジーを管理します。特徴ベースの自己回帰ドラフティング(EAGLE3、EAGLE3.1、P-EAGLE)およびブロック並列ドラフティング(DFlash、Domino、DSpark)など、さまざまなドラフト方法をサポートします。フレームワークは、ローカル オフライン トレーニング、サーバー専用のオンライン分散トレーニング、およびさまざまな並列トポロジー(データ、テンソル、シーケンス並列)をサポートします。

対象者

SGLang を使用して高パフォーマンスな推論を行うために、独自の推測デコード ドラフト モデルをトレーニングし、デプロイしたい開発者および研究者。

ハイライト

  • SGLang 互換性:SGLang と直接互換性があり、移植に追加の作業は必要ありません。
  • 統一トレーニング エントリ ポイント:すべての方法がトレーニングに同じコマンドライン インターフェイスを使用します。
  • 多様なドラフト方法:EAGLE3 や DFlash などの最先端のドラフト テクニックを幅広くサポートします。
  • 柔軟なトレーニング トポロジー:オフライン、オンライン、および分散トレーニング ワークフローをサポートします。
  • SpecBundle:すぐに使用できる高い受容率を持つ本番品質のドラフト モデルのコレクションを提供します。