ai-dynamo/dynamo

A Datacenter Scale Distributed Inference Serving Framework

해결하는 문제

Dynamo은 여러 GPU와 노드를 하나의 고성능 추론 시스템으로 통합하기 위한 데이터센터 규모의 오케스트레이션 레이어입니다. 단일 노드 추론 엔진의 한계를 극복하기 위해 지능형 라우팅, 분리된 서빙, 자동 스케일링을 제공하여 LLM, 멀티모달, 비디오 생성 워크로드의 처리량을 극대화하고 지연 시간을 최소화합니다.

작동 방식

Dynamo은 SGLang, TensorRT-LLM, vLLM과 같은 기존 추론 엔진 위에 위치하며, 이를 대체하지 않습니다. 성능을 위해 Rust를, 확장성을 위해 Python을 조합하여 다음과 같은 핵심 메커니즘을 구현합니다:

  • 분리된 서빙: 추론의 프리필 및 디코드 단계를 별도로 확장 가능한 GPU 풀로 분리합니다.
  • KV 인식 라우팅: 워커 부하와 KV 캐시 겹침을 기반으로 요청을 라우팅하여 중복된 프리필 계산을 제거합니다.
  • KV 블록 매니저 (KVBM): KV 캐시를 GPU, CPU, SSD, 원격 저장소로 오프로드하여 컨텍스트 길이를 연장합니다.
  • ModelExpress: NIXL/NVLink를 통해 GPU 간 모델 가중치를 스트리밍하여 콜드스타트를 빠르게 합니다.
  • SLA 기반 플래너: 워크로드를 프로파일링하여 GPU 풀을 적절한 크기로 조정하고 지연 시간 목표를 달성하는 자동 스케일러입니다.
  • Grove: NVL72 시스템에서 토폴로지 인식 갱스케줄링을 위한 Kubernetes 오퍼레이터입니다.

대상 사용자

다수의 GPU 또는 노드를 통해 LLM을 운영하는 개발자 및 운영자로, 엄격한 지연 시간 SLA를 충족하고, 총 소유 비용(TCO)을 줄이며, 프리필과 디코드를 별도로 확장하고자 하는 분들을 대상으로 합니다.

주요 특징

  • 고성능: 특정 하드웨어에서 DeepSeek-R1에 대해 최대 750배 높은 처리량을 입증했습니다.
  • 엔진 독립성: SGLang, TensorRT-LLM, vLLM 백엔드를 지원합니다.
  • 제로 구성 배포: 베타 기능으로 모델, 하드웨어, SLA를 지정하는 단일 YAML 파일로 배포 가능합니다.
  • OpenAI 호환성: 간편한 통합을 위한 OpenAI 호환 API를 제공합니다.
  • 장애 내성: 캐니어 헬스 체크 및 실행 중 요청 이동 기능을 포함하여 신뢰성을 보장합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트