sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

What it solves

SGLang 是一個高效能的服務框架,旨在解決大型語言模型(LLMs)與多模態模型的低延遲與高吞吐量推論挑戰。它能在各種環境中高效部署,從單一 GPU 到大規模分散式叢集皆適用。

How it works

SGLang 使用快速的執行時,結合多項先進的最佳化技術以最大化效能:

  • Prefix Caching:使用 RadixAttention 有效管理與重複使用提示前綴。
  • Scheduling and Batching:採用零開銷的 CPU 排程器與持續批次處理,優化請求處理。
  • Parallelism:支援張量、管線、專家與資料平行,以因應分散式工作負載。
  • Memory Management:實作分頁注意力與分塊預填。
  • Decoding Optimizations:包含投機解碼與結構化輸出,加速生成。
  • Quantization:支援多種格式,包括 FP4、FP8、INT4、AWQ 與 GPTQ,以降低記憶體佔用。

Who it’s for

  • AI Engineers and Developers:尋求以最高效率與最低延遲部署 LLM 與多模態模型的開發者。
  • MLOps Professionals:需要支援廣泛硬體(NVIDIA、AMD、Intel、Google TPU、Ascend NPU)的穩健、可擴展服務基礎設施的使用者。
  • Researchers:將 SGLang 作為 RL 與後訓練框架的部署後端的研究人員。

Highlights

  • Broad Model Support:相容 Llama、Qwen、DeepSeek、Mistral 等主要開源模型,以及嵌入、獎勵與擴散模型。
  • Extensive Hardware Support:可在多樣硬體上執行,包括最新的 NVIDIA GB200/B300 GPU 與 AMD Instinct MI300 系列。
  • Industry Adoption:每日在全球超過 400,000 塊 GPU 上處理兆級 token。
  • OpenAI API Compatibility:相容大多數 Hugging Face 模型與 OpenAI API,便於整合。