dphnAI/sonar
Large-scale LLM inference engine
解決的問題
Sonar 是一個高性能推理引擎,旨在生產環境中為 Hugging Face 相容的語言與多模態模型提供服務。它解決了大規模部署大型模型時面臨的記憶體管理與吞吐量效率挑戰。
工作原理
基於 vLLM,Sonar 實現了多種先進的記憶體與計算優化。它使用連續批處理與 paged KV-cache 管理來最大化 GPU 顯存利用率。為了進一步提高速度,它使用了投機解碼(透過 EAGLE 與 MTP 等方法)與優化後的內核。它支援無需 Ray 集群即可在多個節點上進行分散式服務,並透過 NIXL 等 KV 連接器實現 prefill/decode 分離。
適用對象
面向需要部署高吞吐量、低延遲生產級 AI 模型的開發人員與機器學習工程師,支援包括 NVIDIA、AMD、Apple silicon 與 Google TPU 在內的廣泛硬體平台。
亮點
- 高吞吐量服務:使用連續批處理與 paged KV-cache 管理。
- 廣泛的硬體支援:相容 NVIDIA CUDA、AMD ROCm、Apple silicon (Metal) 與 Google TPU。
- 分散式服務:支援跨多個節點的張量、流水線、數據與專家並行。
- 進階解碼:實現投機解碼並支援量化權重與 FP8 KV cache。
- 多模態支援:能夠為圖像、音訊與影片模型提供服務。
- API 相容性:提供 OpenAI、Anthropic 與 Kobold API。
相關
- 專案
- 專案
- 專案
- 專案
- 專案