llm-d/llm-d

Achieve state of the art inference performance with modern accelerators on Kubernetes

llm‑d – Kubernetes에서 고성능 분산 LLM 추론

무엇인가요

  • vLLMSGLang과 같은 모델 서버 위에 배치되는 오픈소스 스택으로, 대규모 언어 모델(LLM) 추론을 위한 프로덕션 수준의 오케스트레이션, 라우팅, 캐시 관리를 추가합니다.
  • 클라우드 네이티브 환경(Kubernetes, Helm)을 위한 것으로, Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA가 공동으로 설립한 CNCF 사ند박스 프로젝트를 기반으로 합니다.

핵심 기능

영역 llm‑d가 추가하는 기능
지능형 라우팅 프리픽스 캐시 인식 및 로드 인식 로드 밸런싱; 실험적 지연 예측 스케줄러로 지연을 줄이고 스루풋을 향상시킵니다.
KV 캐시 관리 어텐션 KV 캐시를 CPU 또는 디스크로 계층적으로 오프로드하며, 글로벌 인덱스를 통해 다중 턴 요청이 더 큰 워킹 세트를 유지할 수 있습니다.
대규모 모델 서빙 프리필/디코딩 분리 및 광범위한 전문가 병렬 처리를 통해 거대 모델(예: DeepSeek‑R1, GPT‑OSS‑120B)을 빠른 인터커넥트에 분산합니다.
운영 우수성 다중 테넌트 트래픽용 플로우 컨트롤, SLO 인식 자동 스케일링, 활성-활성 HA를 통해 대규모에서 서비스의 안정성을 유지합니다.
배치 처리 OpenAI 호환 배치 API 및 비동기 파이프라인을 제공하여 오프라인 워크로드를 최적화하고 하드웨어 활용도를 극대화합니다.

성능 강조 (README에 기재된 내용)

  • 프리픽스 캐시 라우팅을 사용한 Llama 3.1 70B에서 출력 스루풋이 3배 향상되고, 최초 토큰 출력 시간(TTFT)이 2배 빨라짐 (4× AMD MI300X).
  • NVIDIA GPU에서 예측 지연 스케줄링을 사용해 TTFT/ITL이 40% 감소.
  • 프리필/디코딩 분리로 GPT‑OSS에서 최대 70% 더 많은 토큰/초를 달성 (AWS B200).
  • 16×16 NVIDIA B200 메시에서 광범위한 전문가 병렬 처리로 클러스터 스루풋이 50k 토큰/초.

사용 방법

  1. 배포 – 빠른 시작 가이드에 따라 Kubernetes 클러스터(모든 클라우드 또는 온프레미스)에 Helm 차트를 설치합니다. 스택은 라우터, 캐시 매니저, 모델 서버 파드를 자동으로 프로비저닝합니다.
  2. 구성 – 모델 크기와 하드웨어 가속기(NVIDIA, AMD, Intel, Google TPU 등)에 맞는 "빛이 비치는 길"(예: Optimized Baseline, Tiered Prefix Cache, Wide Expert-Parallelism)을 선택합니다.
  3. 실행 – 제공된 OpenAI 호환 REST 엔드포인트 또는 배치 API를 통해 추론 요청을 보냅니다. llm‑d는 트래픽을 라우팅하고 KV 캐시 계층을 관리하며 실시간 지연 신호에 따라 파드를 스케일링합니다.
  4. 모니터링 – 내장된 Prometheus 메트릭과 SLO 인식 자동 스케일링을 통해 스루풋, 지연, 리소스 사용량을 모니터링할 수 있습니다.

누가 이득을 볼 수 있나요

  • 낮은 지연과 예측 가능한 비용으로 많은 동시 LLM 사용자를 제공해야 하는 기업.
  • 다양한 가속기에서 최신 모델을 재현 가능하고 클라우드 네이티브 방식으로 실행하고자 하는 ML-ops 팀.
  • 수동으로 Kubernetes 배포를 튜닝하지 않고도 새로운 모델이나 추론 기법을 벤치마크하고 싶은 연구소.

시작하기

  • 빠른 시작 가이드 읽기: https://llm-d.ai/docs/getting-started/quickstart
  • 빛이 비치는 길 문서에서 시작 레시피 선택 (예: optimized-baseline).
  • Helm으로 배포 (리포지토리는 버전 고정 차트 제공). README는 정확한 차트 버전을 릴리스 페이지에 링크합니다.

커뮤니티 및 기여

  • CNCF 승인 프로젝트로 공개 Slack, 이중주기 스탠드업, SIG, 완전한 기여 가이드를 보유하고 있습니다.
  • Apache 2.0 라이선스 – 상업 및 학술 용도 모두 무료입니다.

위 모든 세부 정보는 리포지토리의 README에서 직접 가져왔으며, 추가 기능은 추측되지 않았습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트