sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
What it solves
SGLang 是一个高性能的服务框架,旨在解决大型语言模型(LLMs)和多模态模型的低延迟与高吞吐量推理挑战。它能够在各种环境中高效部署,从单 GPU 到大规模分布式集群皆适用。
How it works
SGLang 使用快速的运行时,结合多项先进的优化技术以最大化性能:
- Prefix Caching:使用 RadixAttention 高效管理和复用提示前缀。
- Scheduling and Batching:采用零开销的 CPU 调度器和持续批处理,优化请求处理。
- Parallelism:支持张量、流水线、专家和数据并行,以应对分布式工作负载。
- Memory Management:实现分页注意力和块状预填充。
- Decoding Optimizations:包括投机解码和结构化输出,加速生成。
- Quantization:支持多种格式,包括 FP4、FP8、INT4、AWQ 和 GPTQ,以降低内存占用。
Who it’s for
- AI Engineers and Developers:寻求以最高效率和最低延迟部署 LLM 与多模态模型的开发者。
- MLOps Professionals:需要支持广泛硬件(NVIDIA、AMD、Intel、Google TPU、Ascend NPU)的稳健、可扩展服务基础设施的用户。
- Researchers:将 SGLang 作为 RL 与后训练框架的部署后端的研究人员。
Highlights
- Broad Model Support:兼容 Llama、Qwen、DeepSeek、Mistral 等主要开源模型,以及嵌入、奖励和扩散模型。
- Extensive Hardware Support:可在多种硬件上运行,包括最新的 NVIDIA GB200/B300 GPU 与 AMD Instinct MI300 系列。
- Industry Adoption:每日在全球超过 400,000 块 GPU 上处理万亿级 token。
- OpenAI API Compatibility:兼容大多数 Hugging Face 模型和 OpenAI API,便于集成。