sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
What it solves
SGLang は、巨大言語モデル(LLMs)およびマルチモーダルモデルの低レイテンシ・高スループット推論という課題を解決するために設計された高性能サービングフレームワークです。単一 GPU から大規模分散クラスターまで、さまざまな環境で効率的にデプロイできます。
How it works
SGLang は高速ランタイムと複数の先進的最適化手法を組み合わせて性能を最大化します:
- Prefix Caching:RadixAttention を使用してプロンプトプレフィックスを効率的に管理・再利用します。
- Scheduling and Batching:ゼロオーバーヘッドの CPU スケジューラと継続的バッチングでリクエスト処理を最適化します。
- Parallelism:テンソル、パイプライン、エキスパート、データ並列をサポートし、分散ワークロードに対応します。
- Memory Management:ページドアテンションとチャンクプリフィルを実装します。
- Decoding Optimizations:投機的デコードと構造化出力を含み、生成速度を向上させます。
- Quantization:FP4、FP8、INT4、AWQ、GPTQ など複数フォーマットをサポートし、メモリフットプリントを削減します。
Who it’s for
- AI Engineers and Developers:最大効率と最小レイテンシで LLM とマルチモーダルモデルをデプロイしたいエンジニア・開発者。
- MLOps Professionals:NVIDIA、AMD、Intel、Google TPU、Ascend NPU など幅広いハードウェアをサポートする堅牢でスケーラブルなサービング基盤を必要とするユーザー。
- Researchers:RL やポストトレーニングフレームワークのバックエンドとして SGLang を利用する研究者。
Highlights
- Broad Model Support:Llama、Qwen、DeepSeek、Mistral など主要なオープンモデルに加え、埋め込み、報酬、拡散モデルにも対応。
- Extensive Hardware Support:最新の NVIDIA GB200/B300 GPU や AMD Instinct MI300 シリーズなど、多様なハードウェア上で動作。
- Industry Adoption:世界中で 40 万台以上の GPU を利用し、日々数兆トークンを処理。
- OpenAI API Compatibility:ほとんどの Hugging Face モデルと OpenAI API と互換性があり、容易に統合可能。