kubeai-project/kubeai
AI Inference Operator for Kubernetes. The easiest way to serve ML models in production. Supports VLMs, LLMs, embeddings, and speech-to-text.
What it solves
KubeAI는 Kubernetes에서 머신러닝 모델의 배포와 스케일링을 간소화합니다. 표준 Kubernetes 로드 밸런싱은 상태를 유지하는 LLM KV 캐시에는 비효율적인 경우가 많아 성능 병목 현상을 일으키는데, 이를 해결합니다. 또한 Istio나 Knative와 같은 복잡한 외부 의존성을 제거하고, 제로부터 스케일링과 같은 기능을 제공합니다.
How it works
KubeAI는 두 가지 주요 구성 요소를 사용합니다:
- Model Proxy: OpenAI 호환 API 게이트웨이로, 프리픽스 인식 로드 밸런싱 전략을 구현해 KV 캐시 활용을 최적화하고 요청 큐잉 및 재시도를 처리합니다.
- Model Operator: Kubernetes 오퍼레이터로, 백엔드 서버 Pod를 관리하며 모델 다운로드, 볼륨 마운트, LoRA 어댑터 오케스트레이션을 자동화합니다.
Who it’s for
CPU, GPU, TPU 등 다양한 하드웨어에서 Kubernetes 위에 LLM, 임베딩 모델, 음성‑텍스트 변환 모델을 실행해야 하는 개발자와 플랫폼 엔지니어를 위해 설계되었습니다. 복잡한 인프라 관리가 필요 없습니다.
Highlights
- Prefix-aware Load Balancing: KV 캐시 적중률을 높여 vLLM 성능을 최적화합니다.
- Scale-from-Zero: 수요에 따라 모델 Pod를 자동으로 시작하며 Knative가 필요 없습니다.
- OpenAI Compatible: 기존 OpenAI 클라이언트 라이브러리와 원활히 작동합니다.
- Hardware Flexible: CPU, GPU, TPU 배포를 지원합니다.
- Broad Model Support: vLLM, Ollama, FasterWhisper, Infinity 서버를 지원합니다.