kubeai-project/kubeai
AI Inference Operator for Kubernetes. The easiest way to serve ML models in production. Supports VLMs, LLMs, embeddings, and speech-to-text.
What it solves
KubeAI は、Kubernetes 上で機械学習モデルのデプロイとスケーリングを簡素化します。標準的な Kubernetes のロードバランシングはステートフルな LLM の KV キャッシュに対して非効率になることが多く、パフォーマンスボトルネックを解消します。また、Istio や Knative といった複雑な外部依存を必要とせず、ゼロからのスケールなどの機能を実現します。
How it works
KubeAI は主に 2 つのコンポーネントで構成されます:
- Model Proxy:OpenAI 互換の API ゲートウェイで、プレフィックス認識ロードバランシング戦略を実装し、KV キャッシュの利用効率を最適化し、リクエストのキューイングとリトライを処理します。
- Model Operator:Kubernetes オペレーターで、バックエンドサーバー Pod を管理し、モデルのダウンロード、ボリュームマウント、LoRA アダプタのオーケストレーションを自動化します。
Who it’s for
CPU、GPU、TPU など様々なハードウェア上で、Kubernetes 上で LLM、埋め込みモデル、音声認識モデルを実行したい開発者やプラットフォームエンジニア向けです。複雑なインフラ管理を必要としません。
Highlights
- Prefix-aware Load Balancing:KV キャッシュヒット率を向上させ、vLLM のパフォーマンスを最適化します。
- Scale-from-Zero:需要に応じてモデル Pod を自動的に起動し、Knative を必要としません。
- OpenAI Compatible:既存の OpenAI クライアントライブラリとシームレスに動作します。
- Hardware Flexible:CPU、GPU、TPU のデプロイをサポートします。
- Broad Model Support:vLLM、Ollama、FasterWhisper、Infinity サーバーを扱えます。