dphnAI/sonar
Large-scale LLM inference engine
해결하는 문제
Sonar는 프로덕션 환경에서 Hugging Face 호환 언어 및 멀티모달 모델을 서빙하기 위해 설계된 고성능 추론 엔진입니다. 대규모 모델을 배포할 때 발생하는 메모리 관리 및 처리량 효율성 문제를 해결합니다.
작동 원리
vLLM을 기반으로 하는 Sonar는 여러 고급 메모리 및 컴퓨팅 최적화를 구현합니다. 연속 배치 및 paged KV-cache 관리를 사용하여 GPU 메모리 활용도를 극대화합니다. 속도를 더욱 높이기 위해 투기적 디코딩(EAGLE 및 MTP와 같은 방법 사용)과 최적화된 커널을 사용합니다. Ray 클러스터 없이도 여러 노드에 걸친 분산 서빙을 지원하며, NIXL과 같은 KV 커넥터를 통해 prefill/decode 분리를 허용합니다.
대상 사용자
NVIDIA, AMD, Apple silicon, Google TPU를 포함한 광범위한 하드웨어 플랫폼을 지원하며, 높은 처리량과 낮은 지연 시간으로 프로덕션급 AI 모델을 배포해야 하는 개발자 및 ML 엔지니어를 대상으로 합니다.
주요 특징
- 고처리량 서빙: 연속 배치 및 paged KV-cache 관리 사용.
- 폭넓은 하드웨어 지원: NVIDIA CUDA, AMD ROCm, Apple silicon (Metal) 및 Google TPU와 호환.
- 분산 서빙: 여러 노드에 걸친 텐서, 파이프라인, 데이터 및 전문가 병렬 처리를 지원.
- 고급 디코딩: 투기적 디코딩을 구현하고 양자화된 가중치 및 FP8 KV cache를 지원.
- 멀티모달 지원: 이미지, 오디오 및 비디오 모델 서빙 가능.
- API 호환성: OpenAI, Anthropic 및 Kobold API 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트