dphnAI/sonar
Large-scale LLM inference engine
解决的问题
Sonar 是一个高性能推理引擎,旨在生产环境中为 Hugging Face 兼容的语言和多模态模型提供服务。它解决了大规模部署大型模型时面临的内存管理和吞吐量效率挑战。
工作原理
基于 vLLM,Sonar 实现了多种先进的内存和计算优化。它使用连续批处理和 paged KV-cache 管理来最大化 GPU 显存利用率。为了进一步提高速度,它使用了投机解码(通过 EAGLE 和 MTP 等方法)和优化后的内核。它支持无需 Ray 集群即可在多个节点上进行分布式服务,并通过 NIXL 等 KV 连接器实现 prefill/decode 分离。
适用对象
面向需要部署高吞吐量、低延迟生产级 AI 模型的开发人员和机器学习工程师,支持包括 NVIDIA、AMD、Apple silicon 和 Google TPU 在内的广泛硬件平台。
亮点
- 高吞吐量服务:使用连续批处理和 paged KV-cache 管理。
- 广泛的硬件支持:兼容 NVIDIA CUDA、AMD ROCm、Apple silicon (Metal) 和 Google TPU。
- 分布式服务:支持跨多个节点的张量、流水线、数据和专家并行。
- 高级解码:实现投机解码并支持量化权重和 FP8 KV cache。
- 多模态支持:能够为图像、音频和视频模型提供服务。
- API 兼容性:提供 OpenAI、Anthropic 和 Kobold API。
相关
- 项目
- 项目
- 项目
- 项目
- 项目