dphnAI/sonar
Large-scale LLM inference engine
What it solves
Sonar는 HuggingFace 호환 모델을 대규모로 서빙하기 위해 설계된 고성능 추론 엔진입니다. 속도를 희생하지 않으면서 GPU 메모리를 효율적으로 관리하고 여러 동시 사용자를 처리하는 과제를 해결합니다.
How it works
Sonar는 vLLM의 Paged Attention 기술을 기반으로 구축되어, continuous batching과 최적화된 CUDA kernels를 사용하여 모델 서빙을 최적화합니다. 메모리 사용량을 줄이기 위해 다양한 양자화 방법(AWQ, GPTQ, GGUF 등)을 지원하며, EAGLE 및 MTP와 같은投機적 디코딩(speculative decoding) 기술을 사용하여 생성 속도를 가속화합니다. 다양한 UI와 쉽게 통합할 수 있도록 OpenAI-compatible API server를 제공합니다.
Who it's for
대규모 사용자에게 LLM을 배포해야 하는 개발자와 플랫폼 제공업체, 그리고 AI 채팅 플랫폼 및 API 인프라를ต้องการ하는 통합자들을 대상으로 합니다.
Highlights
- PagedAttention: 처리량을 최대화하기 위한 효율적인 K/V cache 관리.
- Extensive Quantization Support: AQLM, AutoRound, BitNet을 포함한 광범위한 양자화 지원.
- - Spacing: DRY, XTC, Mirostat와 같은 현대적인 샘플러 지원.
- Scalability: 분산 및 비분리 추론(disaggregated inference) 및 multi-LoRA 지원 기능을 제공합니다.
- Multimodal Support: 멀티모달 모델을 처리할 수 있는 능력을 갖추고 있습니다.