dphnAI/aphrodite-engine
Large-scale LLM inference engine
What it solves
Sonar(구 Aphrodite Engine)는 HuggingFace 호환 모델의 대규모 서비스를 최적화하도록 설계되었으며, 다수의 동시 사용자를 위한 고성능 추론을 가능하게 합니다.
How it works
vLLM의 Paged Attention 기술을 기반으로 엔진은 연속 배치와 최적화된 CUDA 커널을 활용해 처리량을 극대화합니다. AWQ, GPTQ, GGUF와 같은 다양한 양자화 방법과 EAGLE, MTP와 같은 추측 디코딩 기법을 지원해 생성 속도를 높입니다. 또한 OpenAI 호환 API 서버를 제공하여 다양한 UI와의 통합을 용이하게 합니다.
Who it’s for
다수의 사용자가 동시에 대형 언어 모델을 이용해야 하며, 높은 효율성과 낮은 지연 시간을 요구하는 개발자 및 플랫폼 제공자를 위한 솔루션입니다.
Highlights
- Broad Quantization Support: AQLM, AutoRound, BitNet, Marlin 등 다양한 포맷을 통합.
- High-Performance Kernels: PagedAttention 및 최적화된 CUDA 커널을 사용해 추론 속도를 향상.
- Advanced Sampling: DRY, XTC, Mirostat 등 최신 샘플러를 지원.
- Scalability: 분산 및 분리형 추론 기능과 다중 LoRA 지원.
- Multimodal Capabilities: 멀티모달 모델 지원 포함.