dphnAI/aphrodite-engine

Large-scale LLM inference engine

What it solves

Sonar(前身为 Aphrodite Engine)旨在优化 HuggingFace 兼容模型的大规模服务,使多个并发用户都能获得高性能推理。

How it works

基于 vLLM 的 Paged Attention 技术,引擎采用连续批处理和优化的 CUDA 核心,以最大化吞吐量。它支持多种量化方法(如 AWQ、GPTQ、GGUF)和推测解码技术(如 EAGLE、MTP),加速生成。同时提供兼容 OpenAI 的 API 服务器,便于与各种 UI 集成。

Who it’s for

适用于需要同时为大量用户提供大型语言模型服务,且要求高效率、低延迟的开发者和平台提供商。

Highlights

  • Broad Quantization Support: 集成多种格式,包括 AQLM、AutoRound、BitNet 和 Marlin。
  • High-Performance Kernels: 使用 PagedAttention 和优化的 CUDA 核心提升推理速度。
  • Advanced Sampling: 支持现代采样器,如 DRY、XTC 和 Mirostat。
  • Scalability: 具备分布式和解耦式推理,并支持多 LoRA。
  • Multimodal Capabilities: 包含对多模态模型的支持。