dphnAI/aphrodite-engine
Large-scale LLM inference engine
What it solves
Sonar(前身为 Aphrodite Engine)旨在优化 HuggingFace 兼容模型的大规模服务,使多个并发用户都能获得高性能推理。
How it works
基于 vLLM 的 Paged Attention 技术,引擎采用连续批处理和优化的 CUDA 核心,以最大化吞吐量。它支持多种量化方法(如 AWQ、GPTQ、GGUF)和推测解码技术(如 EAGLE、MTP),加速生成。同时提供兼容 OpenAI 的 API 服务器,便于与各种 UI 集成。
Who it’s for
适用于需要同时为大量用户提供大型语言模型服务,且要求高效率、低延迟的开发者和平台提供商。
Highlights
- Broad Quantization Support: 集成多种格式,包括 AQLM、AutoRound、BitNet 和 Marlin。
- High-Performance Kernels: 使用 PagedAttention 和优化的 CUDA 核心提升推理速度。
- Advanced Sampling: 支持现代采样器,如 DRY、XTC 和 Mirostat。
- Scalability: 具备分布式和解耦式推理,并支持多 LoRA。
- Multimodal Capabilities: 包含对多模态模型的支持。