kaito-project/kaito

Kubernetes AI Toolchain Operator

解決的問題

KAITO 簡化了在 Kubernetes 上部署和管理大型語言模型(LLM)的複雜過程。它消除了使用者手動設定詳細部署參數、GPU 資源配置與模型權重儲存的需要,自動完成 AI 工作負載所需的基礎設施編排。

工作原理

KAITO 使用 Kubernetes Operator 模式與自訂資源定義(CRDs)來管理工作負載:

  • Workspace:自動化 LLM 的部署。根據模型與硬體估算 GPU 記憶體需求,透過 Karpenter API 觸發節點自動預置,並以最佳化排程參數配置推理引擎(目前為 vLLM)。
  • InferenceSet:管理模型的副本以實現基於請求負載的自動擴展,與 KEDA 整合以實現指標驅動的擴展。
  • InferencePool:與 Gateway API Inference 扩展整合,實現支援 KVCache 的路由,以高效處理請求。
  • RAGEngine:一個獨立的 Operator,簡化檢索增強生成(RAG)服務的部署,協調 LLM 端點、嵌入服務與向量資料庫(如 FAISS、Qdrant 或 Milvus)。

適用對象

需要在 Kubernetes 上部署 LLM 與 RAG 流水線,但無需手動管理 GPU 基礎設施與擴展邏輯的平台工程師與 DevOps 團隊。

主要亮點

  • 自動 GPU 預置:使用節點自動預置器,根據精確的記憶體估算選擇最適的 GPU 節點數量。
  • 支援 vLLM:支援任何與 vLLM 相容的 HuggingFace 模型。
  • 本地 NVMe 儲存:利用 GPU 節點內建的本地 NVMe 進行模型儲存,避免額外的儲存開銷。
  • 整合 RAG 堆疊:使用 LlamaIndex 提供完整的 RAG 編排,透過 Reciprocal Rank Fusion (RRF) 實現混合搜尋(BM25 與向量密集檢索)。
  • 簡化 API:以針對平行性(PP、DP、TP)最佳化的預設設定取代複雜的部署參數。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案