dphnAI/sonar
Large-scale LLM inference engine
What it solves
Sonar 是一个高-performance 推理引擎,旨在於規模化地服務 HuggingFace 相容模型。它解決了在不犧牲速度的情況下,如何高效管理 GPU 記憶體並處理多個並行用戶的挑戰。
How it works
Sonar 基於 vLLM 的 Paged Attention 技術,透過使用連續批處理 (continuous batching) 和優化的 CUDA kernels,優化了模型服務。它支持廣泛的量化方法 (例如 AWQ, GPTQ, 和 GGUF) 以減少記憶體佔用,並採用了投機性解碼 (speculative decoding) 技術 (例如 EAGLE 和 MTP) 以加速生成。它提供了一個 OpenAI-compatible API server,以便於與各種 UI 進行集成。
Who it's for
它適用於需要為大量用戶部署 LLM 的開發者和平台提供商,以及整合 AI chat 平台和 API 基礎設施的用戶。
Highlights
- PagedAttention: 高效的 K/V cache 管理以最大化吞吐量。
- Extensive Quantization Support: 支持廣泛的量化格式,包括 AQLM, AutoRound, 和 BitNet。
- Advanced Sampling: 支持現代採樣器,例如 DRY, XTC, 和 Mirostat。
- Scalability: 提供分佈式和解耦推理 (disaggregated inference) 以及多-LoRA 支持。
- Multimodal Support: 能夠處理多模態模型。