volcano-sh/kthena
Lightweight, Modular, Kubernetes-native AI serving platform for scalable model serving.
解决的问题
Kthena 旨在简化在生产环境中部署和管理大型语言模型(LLMs)的流程。它解决了在 Kubernetes 原生生态系统中扩展 AI 基础设施的复杂性、优化硬件利用率以及管理模型生命周期的挑战,确保推理工作负载具备可扩展性、成本效益和可靠性。
工作原理
Kthena 通过自定义资源定义(CRDs)扩展 Kubernetes,以管理 LLM 工作负载。它将控制平面(Kthena-controller-manager)与数据平面(Kthena-router)分离。控制器管理器负责模型生命周期、自动扩缩和调度——与 Volcano 调度器集成,支持网络拓扑感知和群组调度。路由器作为流量入口,采用可插拔的负载均衡算法(如 KV 缓存感知路由),并支持高级模式,例如预填充-解码解耦,将计算密集型的预填充操作与令牌生成分离。
适用人群
该平台适用于在生产环境中大规模部署 LLM 的平台工程师、AI 实践者以及组织,他们需要一种云原生方式来管理多种推理引擎(如 vLLM、SGLang 和 Triton),并优化 GPU 资源。
核心亮点
- 多引擎支持:兼容 vLLM、SGLang、Triton 和 TorchServe。
- 预填充-解码解耦:通过分离预填充和解码过程,优化硬件利用率和延迟。
- 智能路由:支持 KV 缓存感知和模型负载感知路由,以及金丝雀发布和基于令牌的限流。
- 高级调度:支持网络拓扑感知调度和分布式推理组的群组调度。
- 成本驱动的自动扩缩:基于 CPU、GPU 和内存指标进行扩缩,支持可配置的预算约束。
- 动态 LoRA 管理:支持热插拔适配器,无需中断服务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目