kubeai-project/kubeai

AI Inference Operator for Kubernetes. The easiest way to serve ML models in production. Supports VLMs, LLMs, embeddings, and speech-to-text.

What it solves

KubeAI 簡化了在 Kubernetes 上部署與擴展機器學習模型的流程。它解決了標準 Kubernetes 負載平衡的效能瓶頸(對於有狀態的 LLM KV 快取往往效率不佳),並且不需要像 Istio 或 Knative 這類複雜的外部依賴,即可實現零起始擴展等功能。

How it works

KubeAI 使用兩個主要元件:

  1. Model Proxy:一個相容 OpenAI API 的閘道,實作前綴感知的負載平衡策略以最佳化 KV 快取使用,並處理請求排隊與重試。
  2. Model Operator:一個 Kubernetes operator,管理後端伺服器 Pod,自動化模型下載、卷掛載,以及 LoRA adapter 的編排。

Who it’s for

此工具設計給需要在 Kubernetes 上執行 LLM、嵌入式模型與語音轉文字模型的開發者與平台工程師,支援各種硬體(CPU、GPU、TPU),且不必管理複雜的基礎設施。

Highlights

  • Prefix-aware Load Balancing:透過提升 KV 快取命中率,優化 vLLM 的效能。
  • Scale-from-Zero:根據需求自動啟動模型 Pod,無需 Knative。
  • OpenAI Compatible:可無縫搭配現有的 OpenAI 客戶端函式庫。
  • Hardware Flexible:支援 CPU、GPU 與 TPU 部署。
  • Broad Model Support:支援 vLLM、Ollama、FasterWhisper 與 Infinity 伺服器。