kubernetes-sigs/gateway-api-inference-extension

Gateway API Inference Extension

해결하는 문제

이 프로젝트는 Kubernetes에서 생성형 AI 모델을 자체 호스팅할 때 발생하는 문제를 해결하며, 요청이 모델 서버로 라우팅되는 방식을 최적화합니다. 특히 부하가 증가할 때 KV 캐시 제거나 대기열로 인한 높은 꼬리 지연과 처리량 감소를 방지합니다.

작동 방식

Envoy의 외부 처리 (ext-proc) 필터를 사용하여 일반적인 Kubernetes Gateway API 호환 프록시(예: Envoy)를 "인퍼런스 게이트웨이"로 변환합니다. 이를 통해 게이트웨이가 인퍼런스 요청을 가로채고, 엔드포인트 피커(EPP)와 인퍼런스 스케줄러를 사용하여 실시간 메트릭과 기능(예: 프리픽스 캐시 상태 또는 LoRA 어댑터 가용성)을 기반으로 가장 최적의 모델 서버 복제본에 요청을 라우팅할 수 있습니다.

대상 사용자

Kubernetes에서 생성형 모델(주로 LLM)을 자체 호스팅하고, 접근 제어를 관리하고, 여러 AI 워크로드에 걸쳐 성능을 최적화하며 운영 가드레일을 유지해야 하는 인퍼런스 플랫폼 팀을 위한 것입니다.

주요 특징

  • KV 캐시 인식 라우팅: 요청 비용과 캐시 상태를 고려한 스케줄링 알고리즘을 통해 처리량을 향상시키고 지연을 줄입니다.
  • LoRA 어댑터 관리: 특정 LoRA 어댑터로 요청을 라우팅하고, 롤아웃, A/B 테스트, 블루-그린 업그레이드를 관리할 수 있는 Kubernetes 네이티브 API를 제공합니다.
  • 플러그인 아키텍처: ext-proc와 Gateway API를 지원하는 어떤 게이트웨이와도 작동하며, llm-d Router를 통해 vLLM과 같은 모델 서버와 통합됩니다.
  • 운영 가드레일: 여러 GenAI 워크로드가 기초 모델 서버 풀을 안전하고 효율적으로 공유할 수 있도록 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트