sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
何を解決するか
SGLang は、大規模言語モデル(LLM)およびマルチモーダルモデルの低遅延・高スループット推論における課題を解決するための高性能サーバーフレームワークです。単一GPUから大規模分散クラスタまで、さまざまなハードウェア環境での効率的なデプロイを可能にします。
動作方法
SGLang は、複数の高度な最適化技術を活用した高速ランタイムを使用して、パフォーマンスを最大化しています:
- RadixAttention:効率的なプレフィックスキャッシュに使用。
- スケジューリングとバッチ処理:オーバーヘッドゼロのCPUスケジューラと連続バッチ処理を採用。
- 並列処理:テンソル並列、パイプライン並列、エキスパート並列、データ並列をサポートし、大規模ワークロードを処理可能。
- メモリ管理:ページ化されたアテンションとチャンク化されたプレフィル処理を使用。
- デコード最適化:推測的デコードと構造化出力を実装。
- 量子化:FP4、FP8、INT4、AWQ、GPTQ など、さまざまなフォーマットをサポート。
対象ユーザー
大規模なLLMおよびマルチモーダルモデルをデプロイする開発者や組織、およびRLやポストトレーニングフレームワーク(例:AReaL、Miles、verl)のロールアウトバックエンドとして使用する研究者に適しています。
主な特徴
- 広範なモデル対応:Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistral に加え、埋め込みモデル、報酬モデル、拡散モデルも対応。
- 多様なハードウェア互換性:NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU、Ascend NPU で動作可能。
- 業界での採用:世界中で40万以上のGPUを駆動し、xAI、NVIDIA、AMDなどの主要テック企業で使用されている。
- OpenAI API互換性:ほとんどのHugging FaceモデルおよびOpenAI APIと互換性あり。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト