llm-d/llm-d-router

llm-d Router: The intelligent entry point for inference requests

해결하는 문제

대규모 언어 모델(LLM)의 추론 트래픽을 효율적으로 라우팅하는 문제를 해결하며, 실시간 신호(부하, 우선순위, KV 캐시 지역성 등)를 기반으로 요청 배치를 최적화함으로써 지연 시간을 줄이고 자원 활용률을 향상시킵니다.

작동 방식

시스템은 Envoy와 같은 프록시와 엔드포인트 피커(EPP)를 통합한 지능형 엔트리 포인트인 llm-d Router로 구성됩니다. EPP는 '뇌' 역할을 하며, 추론 풀의 상태를 기반으로 들어오는 요청에 대한 라우팅 결정을 내립니다. ext-proc 프로토콜을 통해 프록시와 통합됩니다. 스탠드얼론 모드(Envoy와 EPP를 하나의 파드에 배포) 또는 게이트웨이 모드(Kubernetes Gateway API와 통합하여 대규모 트래픽 관리에 사용)로 배포할 수 있습니다.

대상 사용자

LLM 추론 인프라를 관리하는 엔지니어 및 운영자에게 적합합니다. 고급 로드 밸런싱, 요청 우선순위 지정, 복잡한 추론 라이프사이클(예: Prefill/Decode 분리) 지원이 필요한 사용자에게 이상적입니다.

주요 기능

  • KV 캐시 인식 라우팅: 캐시 지역성에 기반해 요청 배치를 최적화합니다.
  • 유연한 배포 옵션: 간단한 스탠드얼론 설정부터 프로덕션 수준의 Kubernetes Gateway API 통합까지 지원합니다.
  • 요청 관리: 스케줄링 목표(InferenceObjective) 설정 및 A/B 테스트를 위한 모델 이름 재작성(InferenceModelRewrite)을 위한 API를 제공합니다.
  • 분리 지원: Encode/Prefill/Decode의 다단계 추론 라이프사이클을 조율하는 사이드카 컴포넌트를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트