kubeai-project/kubeai

AI Inference Operator for Kubernetes. The easiest way to serve ML models in production. Supports VLMs, LLMs, embeddings, and speech-to-text.

What it solves

KubeAI 简化了在 Kubernetes 上部署与扩展机器学习模型的流程。它解决了标准 Kubernetes 负载均衡的性能瓶颈(对于有状态的 LLM KV 缓存往往效率不佳),并且不需要像 Istio 或 Knative 这类复杂的外部依赖,即可实现零起始扩展等功能。

How it works

KubeAI 使用两个主要组件:

  1. Model Proxy:一个兼容 OpenAI API 的网关,实现前缀感知的负载均衡策略以优化 KV 缓存利用,并处理请求排队和重试。
  2. Model Operator:一个 Kubernetes operator,管理后端服务器 Pod,自动化模型下载、卷挂载,以及 LoRA adapter 的编排。

Who it’s for

此工具面向需要在 Kubernetes 上运行 LLM、嵌入模型和语音转文字模型的开发者和平台工程师,支持各种硬件(CPU、GPU、TPU),且无需管理复杂的基础设施。

Highlights

  • Prefix-aware Load Balancing:通过提升 KV 缓存命中率,优化 vLLM 的性能。
  • Scale-from-Zero:根据需求自动启动模型 Pod,无需 Knative。
  • OpenAI Compatible:可无缝配合现有的 OpenAI 客户端库。
  • Hardware Flexible:支持 CPU、GPU 与 TPU 部署。
  • Broad Model Support:支持 vLLM、Ollama、FasterWhisper 与 Infinity 服务器。