llm-d/llm-d

Achieve state of the art inference performance with modern accelerators on Kubernetes

해결하는 문제

llm-d는 대규모 프로덕션 환경에서 대규모 언어 모델(LLM)을 튜닝하고 배포할 때 발생하는 복잡성을 제거하도록 설계되었습니다. 다양한 하드웨어 가속기에서 처리량을 극대화하고 지연 시간을 줄이는 오케스트레이션 및 최적화 레이어를 제공함으로써 표준 모델 서버의 성능 병목 현상을 해결합니다.

작동 방식

llm-d는 vLLM 및 Kubernetes와 같은 업계 표준 기술과 통합되어 분산 추론 서빙 스택을 제공합니다. 성능을 최적화하기 위해 다음과 같은 고급 기술을 사용합니다:

  • 지능형 라우팅: prefix-cache 및 부하 인식 밸런싱, 예측 지연 시간 스케줄링을 사용하여 지연 시간을 줄이고 처리량을 높입니다.
  • KV-Cache 관리: CPU 또는 디스크로의 계층적 오프로딩과 글로벌 인덱싱을 구현하여 멀티 턴 요청에 대한 유효 워킹 셋 크기를 늘립니다.
  • 대규모 모델 서빙: prefill/decode disaggregation 및 고속 인터커넥트를 통한 광범위한 전문가 병렬 처리를 활용하여 거대 모델을 최적화합니다.
  • 운영 우수성: 멀티 테넌트 서빙을 위한 지능형 흐름 제어와 실시간 신호 기반의 SLO 인식 오토스케일링을 제공합니다.
  • 배치 처리: OpenAI 호환 Batch API 및 비동기 처리를 통해 대규모 오프라인 추론을 관리합니다.

대상

이 프로젝트는 Kubernetes 프로덕션 환경에서 LLM을 배포하고, 다양한 하드웨어 가속기(NVIDIA, AMD, Intel, Google TPU 등)에서 최첨단(SOTA) 추론 성능을 달성하고자 하는 엔지니어 및 조직을 위한 것입니다.

주요 특징

  • CNCF Sandbox Project: Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA를 포함한 업계 리더들에 의해 설립되었습니다.

  • 상당한 성능 향상: prefix-cache 인식 라우팅을 통해 출력 처리량 3배 증가 및 TTFT 2배 단축이 검증되었습니다.

  • 광범위한 하드웨어 지원: 다양한 가속기 및 인프라 제공업체에 최적화되어 있습니다.

  • 프로덕션 준비 완료 레시피: 배포와 베스트 프랙티스를 단순화하기 위한 벤치마크 가이드 및 Helm 차트를 제공합니다.