sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
解决的问题
SGLang 是一个高性能推理框架,旨在解决大语言模型(LLMs)和多模态模型的低延迟、高吞吐量推理挑战。它支持从单个 GPU 到大规模分布式集群的多种硬件部署,实现高效部署。
工作原理
SGLang 采用快速运行时,并结合多种先进优化技术以最大化性能:
- RadixAttention:用于高效前缀缓存。
- 调度与批处理:采用零开销 CPU 调度器和连续批处理。
- 并行处理:支持张量、流水线、专家和数据并行,以处理大规模工作负载。
- 内存管理:使用分页注意力和分块预填充。
- 解码优化:实现推测性解码和结构化输出。
- 量化:支持 FP4、FP8、INT4、AWQ 和 GPTQ 等多种格式。
适用人群
适用于大规模部署 LLM 和多模态模型的开发者和组织,以及将其用作 RL 和后训练框架(如 AReaL、Miles 和 verl)的部署后端的研究人员。
主要亮点
- 广泛模型支持:兼容 Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma 和 Mistral,以及嵌入、奖励和扩散模型。
- 多硬件兼容性:可在 NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU 和 Ascend NPU 上运行。
- 行业采用:全球已驱动超过 40 万块 GPU,被 xAI、NVIDIA 和 AMD 等主要科技公司使用。
- OpenAI API 兼容性:与大多数 Hugging Face 模型和 OpenAI API 兼容。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目