dphnAI/sonar

Large-scale LLM inference engine

해결하는 문제

Sonar는 프로덕션 환경에서 Hugging Face 호환 언어 및 멀티모달 모델을 서빙하기 위해 설계된 고성능 추론 엔진입니다. 대규모 모델을 배포할 때 발생하는 메모리 관리 및 처리량 효율성 문제를 해결합니다.

작동 원리

vLLM을 기반으로 하는 Sonar는 여러 고급 메모리 및 컴퓨팅 최적화를 구현합니다. 연속 배치 및 paged KV-cache 관리를 사용하여 GPU 메모리 활용도를 극대화합니다. 속도를 더욱 높이기 위해 투기적 디코딩(EAGLE 및 MTP와 같은 방법 사용)과 최적화된 커널을 사용합니다. Ray 클러스터 없이도 여러 노드에 걸친 분산 서빙을 지원하며, NIXL과 같은 KV 커넥터를 통해 prefill/decode 분리를 허용합니다.

대상 사용자

NVIDIA, AMD, Apple silicon, Google TPU를 포함한 광범위한 하드웨어 플랫폼을 지원하며, 높은 처리량과 낮은 지연 시간으로 프로덕션급 AI 모델을 배포해야 하는 개발자 및 ML 엔지니어를 대상으로 합니다.

주요 특징

  • 고처리량 서빙: 연속 배치 및 paged KV-cache 관리 사용.
  • 폭넓은 하드웨어 지원: NVIDIA CUDA, AMD ROCm, Apple silicon (Metal) 및 Google TPU와 호환.
  • 분산 서빙: 여러 노드에 걸친 텐서, 파이프라인, 데이터 및 전문가 병렬 처리를 지원.
  • 고급 디코딩: 투기적 디코딩을 구현하고 양자화된 가중치 및 FP8 KV cache를 지원.
  • 멀티모달 지원: 이미지, 오디오 및 비디오 모델 서빙 가능.
  • API 호환성: OpenAI, Anthropic 및 Kobold API 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트