volcano-sh/kthena

Lightweight, Modular, Kubernetes-native AI serving platform for scalable model serving.

解決的問題

Kthena 是為簡化生產環境中大型語言模型(LLMs)的部署與管理而設計的。它解決了在 Kubernetes 原生生態系中擴展 AI 基礎設施的複雜性、最佳化硬體利用率,以及管理模型生命週期的挑戰,確保推論工作負載具備可擴展性、成本效益與可靠性。

工作原理

Kthena 透過自訂資源定義(CRDs)擴展 Kubernetes,以管理 LLM 工作負載。它將控制平面(Kthena-controller-manager)與資料平面(Kthena-router)分離。控制器管理器負責模型生命週期、自動擴縮與排程——與 Volcano 排程器整合,支援網路拓撲感知與群組排程。路由器作為流量入口,採用可插入的負載平衡演算法(例如 KV 快取感知路由),並支援進階模式,如預填入-解碼解耦,將計算密集型的預填入作業與詞元產生分離。

適用對象

此平台適用於在生產環境中大規模部署 LLM 的平台工程師、AI 實務者與組織,他們需要一種雲原生方式來管理多種推論引擎(如 vLLM、SGLang 和 Triton),並最佳化 GPU 資源。

核心亮點

  • 多引擎支援:相容 vLLM、SGLang、Triton 與 TorchServe。
  • 預填入-解碼解耦:透過分離預填入與解碼流程,最佳化硬體利用率與延遲。
  • 智能路由:具備 KV 快取感知與模型負載感知路由,以及金絲雀發布與基於令牌的速率限制。
  • 進階排程:包含網路拓撲感知排程與分散式推論群組的群組排程。
  • 成本驅動自動擴縮:根據 CPU、GPU 與記憶體指標進行擴縮,支援可設定的預算限制。
  • 動態 LoRA 管理:支援熱插拔適配器,無需中斷服務。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案