vllm-project/production-stack
vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization
해결하는 문제
이 프로젝트는 vLLM을 생산 환경에 배포하기 위한 참조 구현을 제공합니다. 애플리케이션 코드를 수정하지 않고 단일 인스턴스에서 분산 배포로 확장하는 문제를 해결하며, 내장된 모니터링과 성능 최적화(예: 요청 라우팅, KV 캐시 오프로딩)를 제공합니다.
작동 방식
이 스택은 Kubernetes에서 Helm을 통해 배포되며, 주로 세 가지 구성 요소로 구성됩니다:
- 서빙 엔진: 여러 개의 vLLM 엔진이 LLM을 실행합니다.
- 요청 라우터: 라우팅 키나 세션 ID를 기반으로 트래픽을 가장 적절한 백엔드로 전달하여 KV 캐시 재사용을 극대화합니다.
- 관측성 스택: Prometheus와 Grafana를 사용한 모니터링 시스템으로 지연 시간, Time-to-First-Token (TTFT), GPU KV 캐시 사용량 등의 메트릭을 추적합니다.
대상 사용자
AWS, GCP, Azure, Lambda Labs 등의 다양한 클라우드 플랫폼에서 단일 노드 설정에서 스케일링 가능하고 생산 준비 완료된 Kubernetes 클러스터로 vLLM 기반 LLM 서빙을 이전하고자 하는 개발자 및 ML 엔지니어.
주요 특징
- 무중단 확장: 애플리케이션 코드 수정 없이 vLLM 인스턴스를 확장 가능.
- 지능형 라우팅: 라운드로빈 및 세션 ID 기반 라우팅을 지원하여 효율성 향상.
- OpenAI API 호환성: vLLM과 동일한 인터페이스를 유지하여 간편한 통합 가능.
- 포괄적인 모니터링: 요청 지연 시간, 보류 중인 요청, KV 캐시 히트율을 추적하는 상세한 Grafana 대시보드.
- KV 캐시 오프로딩: LMCache와의 통합을 통해 성능 최적화.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트