llm-d/llm-d
Achieve state of the art inference performance with modern accelerators on Kubernetes
llm‑d – Kubernetes에서 고성능 분산 LLM 추론
무엇인가요
- vLLM 및 SGLang과 같은 모델 서버 위에 배치되는 오픈소스 스택으로, 대규모 언어 모델(LLM) 추론을 위한 프로덕션 수준의 오케스트레이션, 라우팅, 캐시 관리를 추가합니다.
- 클라우드 네이티브 환경(Kubernetes, Helm)을 위한 것으로, Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA가 공동으로 설립한 CNCF 사ند박스 프로젝트를 기반으로 합니다.
핵심 기능
| 영역 | llm‑d가 추가하는 기능 |
|---|---|
| 지능형 라우팅 | 프리픽스 캐시 인식 및 로드 인식 로드 밸런싱; 실험적 지연 예측 스케줄러로 지연을 줄이고 스루풋을 향상시킵니다. |
| KV 캐시 관리 | 어텐션 KV 캐시를 CPU 또는 디스크로 계층적으로 오프로드하며, 글로벌 인덱스를 통해 다중 턴 요청이 더 큰 워킹 세트를 유지할 수 있습니다. |
| 대규모 모델 서빙 | 프리필/디코딩 분리 및 광범위한 전문가 병렬 처리를 통해 거대 모델(예: DeepSeek‑R1, GPT‑OSS‑120B)을 빠른 인터커넥트에 분산합니다. |
| 운영 우수성 | 다중 테넌트 트래픽용 플로우 컨트롤, SLO 인식 자동 스케일링, 활성-활성 HA를 통해 대규모에서 서비스의 안정성을 유지합니다. |
| 배치 처리 | OpenAI 호환 배치 API 및 비동기 파이프라인을 제공하여 오프라인 워크로드를 최적화하고 하드웨어 활용도를 극대화합니다. |
성능 강조 (README에 기재된 내용)
- 프리픽스 캐시 라우팅을 사용한 Llama 3.1 70B에서 출력 스루풋이 3배 향상되고, 최초 토큰 출력 시간(TTFT)이 2배 빨라짐 (4× AMD MI300X).
- NVIDIA GPU에서 예측 지연 스케줄링을 사용해 TTFT/ITL이 40% 감소.
- 프리필/디코딩 분리로 GPT‑OSS에서 최대 70% 더 많은 토큰/초를 달성 (AWS B200).
- 16×16 NVIDIA B200 메시에서 광범위한 전문가 병렬 처리로 클러스터 스루풋이 50k 토큰/초.
사용 방법
- 배포 – 빠른 시작 가이드에 따라 Kubernetes 클러스터(모든 클라우드 또는 온프레미스)에 Helm 차트를 설치합니다. 스택은 라우터, 캐시 매니저, 모델 서버 파드를 자동으로 프로비저닝합니다.
- 구성 – 모델 크기와 하드웨어 가속기(NVIDIA, AMD, Intel, Google TPU 등)에 맞는 "빛이 비치는 길"(예: Optimized Baseline, Tiered Prefix Cache, Wide Expert-Parallelism)을 선택합니다.
- 실행 – 제공된 OpenAI 호환 REST 엔드포인트 또는 배치 API를 통해 추론 요청을 보냅니다. llm‑d는 트래픽을 라우팅하고 KV 캐시 계층을 관리하며 실시간 지연 신호에 따라 파드를 스케일링합니다.
- 모니터링 – 내장된 Prometheus 메트릭과 SLO 인식 자동 스케일링을 통해 스루풋, 지연, 리소스 사용량을 모니터링할 수 있습니다.
누가 이득을 볼 수 있나요
- 낮은 지연과 예측 가능한 비용으로 많은 동시 LLM 사용자를 제공해야 하는 기업.
- 다양한 가속기에서 최신 모델을 재현 가능하고 클라우드 네이티브 방식으로 실행하고자 하는 ML-ops 팀.
- 수동으로 Kubernetes 배포를 튜닝하지 않고도 새로운 모델이나 추론 기법을 벤치마크하고 싶은 연구소.
시작하기
- 빠른 시작 가이드 읽기: https://llm-d.ai/docs/getting-started/quickstart
- 빛이 비치는 길 문서에서 시작 레시피 선택 (예:
optimized-baseline). - Helm으로 배포 (리포지토리는 버전 고정 차트 제공). README는 정확한 차트 버전을 릴리스 페이지에 링크합니다.
커뮤니티 및 기여
- CNCF 승인 프로젝트로 공개 Slack, 이중주기 스탠드업, SIG, 완전한 기여 가이드를 보유하고 있습니다.
- Apache 2.0 라이선스 – 상업 및 학술 용도 모두 무료입니다.
위 모든 세부 정보는 리포지토리의 README에서 직접 가져왔으며, 추가 기능은 추측되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트