volcano-sh/kthena
Lightweight, Modular, Kubernetes-native AI serving platform for scalable model serving.
해결하는 문제
Kthena는 대규모 언어 모델(LLM)을 프로덕션 환경에서 배포하고 관리하는 것을 간소화하기 위해 설계되었습니다. Kubernetes 기반 생태계 내에서 AI 인프라 확장의 복잡성, 하드웨어 활용 최적화, 모델 라이프사이클 관리를 해결하여 추론 워크로드가 확장 가능하고 비용 효율적이며 신뢰할 수 있도록 보장합니다.
작동 방식
Kthena는 사용자 정의 리소스 정의(CRD)를 사용하여 Kubernetes를 확장하여 LLM 워크로드를 관리합니다. 제어 평면(Kthena-controller-manager)과 데이터 평면(Kthena-router)을 분리합니다. 컨트롤러 매니저는 모델 라이프사이클, 오토스케일링, 스케줄링을 처리하며, 네트워크 토폴로지 인식 및 간그 스케줄링을 위해 Volcano 스케줄러와 통합됩니다. 라우터는 트래픽의 진입점으로 작동하며, 플러그인 가능한 로드 밸런싱 알고리즘(예: KV 캐시 인식 라우팅)을 사용하고, 계산 집약적인 프리필 연산과 토큰 생성을 분리하는 고급 패턴인 프리필-디코드 분리 기능을 지원합니다.
대상 사용자
이 플랫폼은 대규모로 LLM을 프로덕션 환경에 배포하는 플랫폼 엔지니어, AI 전문가, 조직을 위한 것입니다. 여러 추론 엔진(vLLM, SGLang, Triton 등)을 관리하고 GPU 리소스를 최적화할 수 있는 클라우드 네이티브 방식을 필요로 하는 사용자에게 적합합니다.
주요 특징
- 다중 엔진 지원: vLLM, SGLang, Triton, TorchServe와 호환됩니다.
- 프리필-디코드 분리: 프리필과 디코드 프로세스를 분리하여 하드웨어 활용도와 지연 시간을 최적화합니다.
- 지능형 라우팅: KV 캐시 인식 및 모델 부하 인식 라우팅, 캐니 테스트, 토큰 기반 레이트 제한 기능을 제공합니다.
- 고급 스케줄링: 네트워크 토폴로지 인식 스케줄링 및 분산 추론 그룹을 위한 간그 스케줄링을 포함합니다.
- 비용 기반 오토스케일링: CPU, GPU, 메모리 메트릭을 기반으로 설정 가능한 예산 제약 조건으로 스케일링합니다.
- 동적 LoRA 관리: 서비스 중단 없이 어댑터를 실시간으로 교체할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트