kaito-project/kaito

Kubernetes AI Toolchain Operator

解决的问题

KAITO 简化了在 Kubernetes 上部署和管理大型语言模型(LLM)的复杂过程。它消除了用户手动配置详细部署参数、GPU 资源分配和模型权重存储的需要,自动完成 AI 工作负载所需的基础设施编排。

工作原理

KAITO 使用 Kubernetes Operator 模式和自定义资源定义(CRDs)来管理工作负载:

  • Workspace:自动化 LLM 的部署。基于模型和硬件估算 GPU 内存需求,通过 Karpenter API 触发节点自动预置,并使用优化的调度参数配置推理引擎(当前为 vLLM)。
  • InferenceSet:管理模型的副本以实现基于请求负载的自动伸缩,与 KEDA 集成以实现基于指标的伸缩。
  • InferencePool:与 Gateway API Inference 扩展集成,实现支持 KVCache 的路由,以高效处理请求。
  • RAGEngine:一个独立的 Operator,简化检索增强生成(RAG)服务的部署,协调 LLM 端点、嵌入服务和向量数据库(如 FAISS、Qdrant 或 Milvus)。

适用人群

需要在 Kubernetes 上部署 LLM 和 RAG 流水线,但无需手动管理 GPU 基础设施和伸缩逻辑的平台工程师和 DevOps 团队。

主要亮点

  • 自动 GPU 预置:使用节点自动预置器,基于精确的内存估算选择最优 GPU 节点数量。
  • 支持 vLLM:支持任何与 vLLM 兼容的 HuggingFace 模型。
  • 本地 NVMe 存储:利用 GPU 节点内置的本地 NVMe 进行模型存储,避免额外的存储开销。
  • 集成 RAG 堆栈:使用 LlamaIndex 提供完整的 RAG 编排,通过 Reciprocal Rank Fusion (RRF) 实现混合搜索(BM25 和向量密集检索)。
  • 简化 API:用针对并行性(PP、DP、TP)优化的预设配置替代复杂的部署参数。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目