dphnAI/aphrodite-engine

Large-scale LLM inference engine

What it solves

Sonar(前身為 Aphrodite Engine)旨在優化 HuggingFace 相容模型的大規模服務,讓多位同時使用者都能獲得高效能的推論。

How it works

基於 vLLM 的 Paged Attention 技術,該引擎使用持續批次處理與最佳化的 CUDA 核心,最大化吞吐量。它支援多種量化方法(例如 AWQ、GPTQ、GGUF)以及推測解碼技術(如 EAGLE、MTP),以加速生成。另提供相容 OpenAI 的 API 伺服器,方便與各種 UI 整合。

Who it’s for

適用於需要同時為大量使用者提供大型語言模型服務,且要求高效率與低延遲的開發者與平台提供者。

Highlights

  • Broad Quantization Support: 整合多種格式,包括 AQLM、AutoRound、BitNet 與 Marlin。
  • High-Performance Kernels: 使用 PagedAttention 與最佳化的 CUDA 核心提升推論速度。
  • Advanced Sampling: 支援現代抽樣器,如 DRY、XTC 與 Mirostat。
  • Scalability: 提供分散式與解耦式推論,並支援多 LoRA。
  • Multimodal Capabilities: 包含對多模態模型的支援。