sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
解決的問題
SGLang 是一個高性能的伺服框架,專為解決大語言模型(LLMs)與多模態模型的低延遲、高吞吐量推理挑戰而設計。它支援從單一 GPU 到大型分散式叢集的各種硬體部署,實現高效部署。
工作原理
SGLang 採用快速執行時,並結合多項先進最佳化技術以最大化效能:
- RadixAttention:用於高效前綴快取。
- 排程與批次處理:採用零開銷 CPU 排程器與連續批次處理。
- 平行處理:支援張量、流水線、專家與資料平行,以處理大規模工作負載。
- 記憶體管理:使用分頁注意力與分塊預填。
- 解碼最佳化:實作推測性解碼與結構化輸出。
- 量化:支援 FP4、FP8、INT4、AWQ 與 GPTQ 等多種格式。
適用對象
適用於大規模部署 LLM 與多模態模型的開發者與組織,以及作為 RL 與後訓練框架(如 AReaL、Miles 與 verl)的部署後端的研究人員。
主要亮點
- 廣泛模型支援:相容 Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma 與 Mistral,以及嵌入、獎勵與擴散模型。
- 多硬體相容性:可在 NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU 與 Ascend NPU 上執行。
- 產業採用:全球已驅動超過 40 萬張 GPU,並被 xAI、NVIDIA 與 AMD 等主要科技公司使用。
- OpenAI API 相容性:與大多數 Hugging Face 模型與 OpenAI API 相容。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案