sgl-project/SpecForge
Train speculative decoding models effortlessly and port them smoothly to SGLang serving.
何を解決するか
SpecForgeは、投機的デコーディング(speculative decoding)モデル向けの、適切にメンテナンスされ、互換性のあるトレーニングフレームワークの不足に対処します。これにより、これらのモデルを標準化された方法でトレーニングし、SGLangサービングフレームワークへシームレスに移植してLLMの推論速度を加速させることが可能になります。
仕組み
SpecForgeは、統一された型指定済みのトレーニング・エントリーポイントを使用しており、ユーザーはYAMLファイルを通じて異なるドラフティング手法やデプロイメント・トポロジーを設定できます。オンラインの分散型トレーニング(disaggregated training)や、コロケート(colocated)および分散型(disaggregated)のオフライン・トレーニングを含む、複数のトレーニングモードをサポートしています。また、このフレームワークは、トレーニングプロセスを最適化するために、さまざまなデータ、テンソル、およびシーケンスの並列トポロジーをサポートしています。
対象者
LLMの推論パフォーマンスを向上させるために、投機的デコーディングのドラフトモデルをトレーニングしたい開発者や研究者、特にSGLangサービングフレームワークを使用している方を対象としています。
ハイライト
- SGLang互換性: SpecForgeでトレーニングされたモデルは、SGLangで動作させるために追加の移植作業を必要としません。
- 多様なドラフティング手法: EAGLE3、P-EAGLE、DFlash、DFlash2、Domino、DSparkを含む幅広い技術をサポートしています。
- 柔軟なトレーニング・トポロジー: コロケートまたは分散型のセットアップオプションを備えた、オンラインおよびオフラインのトレーニングをサポートしています。
- SpecBundle: すぐに使用可能な、プロダクショングレードの事前学習済み投機的デコーディングモデルのコレクションを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch