sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

What it solves

SGLang 是一个高性能的服务框架,旨在解决大型语言模型(LLMs)和多模态模型的低延迟与高吞吐量推理挑战。它能够在各种环境中高效部署,从单 GPU 到大规模分布式集群皆适用。

How it works

SGLang 使用快速的运行时,结合多项先进的优化技术以最大化性能:

  • Prefix Caching:使用 RadixAttention 高效管理和复用提示前缀。
  • Scheduling and Batching:采用零开销的 CPU 调度器和持续批处理,优化请求处理。
  • Parallelism:支持张量、流水线、专家和数据并行,以应对分布式工作负载。
  • Memory Management:实现分页注意力和块状预填充。
  • Decoding Optimizations:包括投机解码和结构化输出,加速生成。
  • Quantization:支持多种格式,包括 FP4、FP8、INT4、AWQ 和 GPTQ,以降低内存占用。

Who it’s for

  • AI Engineers and Developers:寻求以最高效率和最低延迟部署 LLM 与多模态模型的开发者。
  • MLOps Professionals:需要支持广泛硬件(NVIDIA、AMD、Intel、Google TPU、Ascend NPU)的稳健、可扩展服务基础设施的用户。
  • Researchers:将 SGLang 作为 RL 与后训练框架的部署后端的研究人员。

Highlights

  • Broad Model Support:兼容 Llama、Qwen、DeepSeek、Mistral 等主要开源模型,以及嵌入、奖励和扩散模型。
  • Extensive Hardware Support:可在多种硬件上运行,包括最新的 NVIDIA GB200/B300 GPU 与 AMD Instinct MI300 系列。
  • Industry Adoption:每日在全球超过 400,000 块 GPU 上处理万亿级 token。
  • OpenAI API Compatibility:兼容大多数 Hugging Face 模型和 OpenAI API,便于集成。