sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

解決的問題

SGLang 是一個高性能的伺服框架,專為解決大語言模型(LLMs)與多模態模型的低延遲、高吞吐量推理挑戰而設計。它支援從單一 GPU 到大型分散式叢集的各種硬體部署,實現高效部署。

工作原理

SGLang 採用快速執行時,並結合多項先進最佳化技術以最大化效能:

  • RadixAttention:用於高效前綴快取。
  • 排程與批次處理:採用零開銷 CPU 排程器與連續批次處理。
  • 平行處理:支援張量、流水線、專家與資料平行,以處理大規模工作負載。
  • 記憶體管理:使用分頁注意力與分塊預填。
  • 解碼最佳化:實作推測性解碼與結構化輸出。
  • 量化:支援 FP4、FP8、INT4、AWQ 與 GPTQ 等多種格式。

適用對象

適用於大規模部署 LLM 與多模態模型的開發者與組織,以及作為 RL 與後訓練框架(如 AReaL、Miles 與 verl)的部署後端的研究人員。

主要亮點

  • 廣泛模型支援:相容 Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma 與 Mistral,以及嵌入、獎勵與擴散模型。
  • 多硬體相容性:可在 NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU 與 Ascend NPU 上執行。
  • 產業採用:全球已驅動超過 40 萬張 GPU,並被 xAI、NVIDIA 與 AMD 等主要科技公司使用。
  • OpenAI API 相容性:與大多數 Hugging Face 模型與 OpenAI API 相容。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案