sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

解决的问题

SGLang 是一个高性能推理框架,旨在解决大语言模型(LLMs)和多模态模型的低延迟、高吞吐量推理挑战。它支持从单个 GPU 到大规模分布式集群的多种硬件部署,实现高效部署。

工作原理

SGLang 采用快速运行时,并结合多种先进优化技术以最大化性能:

  • RadixAttention:用于高效前缀缓存。
  • 调度与批处理:采用零开销 CPU 调度器和连续批处理。
  • 并行处理:支持张量、流水线、专家和数据并行,以处理大规模工作负载。
  • 内存管理:使用分页注意力和分块预填充。
  • 解码优化:实现推测性解码和结构化输出。
  • 量化:支持 FP4、FP8、INT4、AWQ 和 GPTQ 等多种格式。

适用人群

适用于大规模部署 LLM 和多模态模型的开发者和组织,以及将其用作 RL 和后训练框架(如 AReaL、Miles 和 verl)的部署后端的研究人员。

主要亮点

  • 广泛模型支持:兼容 Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma 和 Mistral,以及嵌入、奖励和扩散模型。
  • 多硬件兼容性:可在 NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU 和 Ascend NPU 上运行。
  • 行业采用:全球已驱动超过 40 万块 GPU,被 xAI、NVIDIA 和 AMD 等主要科技公司使用。
  • OpenAI API 兼容性:与大多数 Hugging Face 模型和 OpenAI API 兼容。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目