dphnAI/sonar

Large-scale LLM inference engine

What it solves

Sonar 是一个高-performance 推理引擎,旨在於規模化地服務 HuggingFace 相容模型。它解決了在不犧牲速度的情況下,如何高效管理 GPU 記憶體並處理多個並行用戶的挑戰。

How it works

Sonar 基於 vLLM 的 Paged Attention 技術,透過使用連續批處理 (continuous batching) 和優化的 CUDA kernels,優化了模型服務。它支持廣泛的量化方法 (例如 AWQ, GPTQ, 和 GGUF) 以減少記憶體佔用,並採用了投機性解碼 (speculative decoding) 技術 (例如 EAGLE 和 MTP) 以加速生成。它提供了一個 OpenAI-compatible API server,以便於與各種 UI 進行集成。

Who it's for

它適用於需要為大量用戶部署 LLM 的開發者和平台提供商,以及整合 AI chat 平台和 API 基礎設施的用戶。

Highlights

  • PagedAttention: 高效的 K/V cache 管理以最大化吞吐量。
  • Extensive Quantization Support: 支持廣泛的量化格式,包括 AQLM, AutoRound, 和 BitNet。
  • Advanced Sampling: 支持現代採樣器,例如 DRY, XTC, 和 Mirostat。
  • Scalability: 提供分佈式和解耦推理 (disaggregated inference) 以及多-LoRA 支持。
  • Multimodal Support: 能夠處理多模態模型。