sgl-project/SpecForge

Train speculative decoding models effortlessly and port them smoothly to SGLang serving.

何を解決するか

SpecForgeは、投機的デコーディング(speculative decoding)モデル向けの、適切にメンテナンスされ、互換性のあるトレーニングフレームワークの不足に対処します。これにより、これらのモデルを標準化された方法でトレーニングし、SGLangサービングフレームワークへシームレスに移植してLLMの推論速度を加速させることが可能になります。

仕組み

SpecForgeは、統一された型指定済みのトレーニング・エントリーポイントを使用しており、ユーザーはYAMLファイルを通じて異なるドラフティング手法やデプロイメント・トポロジーを設定できます。オンラインの分散型トレーニング(disaggregated training)や、コロケート(colocated)および分散型(disaggregated)のオフライン・トレーニングを含む、複数のトレーニングモードをサポートしています。また、このフレームワークは、トレーニングプロセスを最適化するために、さまざまなデータ、テンソル、およびシーケンスの並列トポロジーをサポートしています。

対象者

LLMの推論パフォーマンスを向上させるために、投機的デコーディングのドラフトモデルをトレーニングしたい開発者や研究者、特にSGLangサービングフレームワークを使用している方を対象としています。

ハイライト

  • SGLang互換性: SpecForgeでトレーニングされたモデルは、SGLangで動作させるために追加の移植作業を必要としません。
  • 多様なドラフティング手法: EAGLE3、P-EAGLE、DFlash、DFlash2、Domino、DSparkを含む幅広い技術をサポートしています。
  • 柔軟なトレーニング・トポロジー: コロケートまたは分散型のセットアップオプションを備えた、オンラインおよびオフラインのトレーニングをサポートしています。
  • SpecBundle: すぐに使用可能な、プロダクショングレードの事前学習済み投機的デコーディングモデルのコレクションを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch