volcano-sh/kthena

Lightweight, Modular, Kubernetes-native AI serving platform for scalable model serving.

何を解決するか

Kthenaは、本番環境での大規模言語モデル(LLM)のデプロイと管理を簡素化することを目的としています。Kubernetesネイティブなエコシステム内で、AIインフラのスケーリングの複雑さ、ハードウェア利用効率の最適化、モデルライフサイクルの管理を解決し、推論ワークロードがスケーラブルでコスト効率が高く、信頼性が高いことを保証します。

動作方法

Kthenaはカスタムリソース定義(CRD)を使用してKubernetesを拡張し、LLMワークロードを管理します。コントロールプレーン(Kthena-controller-manager)とデータプレーン(Kthena-router)を分離しています。コントローラーマネージャーはモデルライフサイクル、オートスケーリング、スケジューリングを担当し、ネットワークトポロジー対応およびギャングスケジューリングを実現するためVolcanoスケジューラーと統合しています。ルーターはトラフィックのエントリーポイントとして機能し、プラグイン可能な負荷分散アルゴリズム(例:KVキャッシュ対応ルーティング)を採用しており、計算集約的なプレフィル処理とトークン生成を分離する「プレフィル-デコードの非統合」をサポートしています。

対象ユーザー

このプラットフォームは、本番環境で大規模にLLMを展開するプラットフォームエンジニア、AI実践者、および組織向けです。複数の推論エンジン(vLLM、SGLang、Tritonなど)を管理し、GPUリソースを最適化するクラウドネイティブな方法を必要とする方々に適しています。

主な特徴

  • マルチエンジン対応:vLLM、SGLang、Triton、TorchServeと互換性があります。
  • プレフィル-デコードの非統合:プレフィル処理とデコード処理を分離することで、ハードウェア利用効率と遅延を最適化します。
  • インテリジェントルーティング:KVキャッシュ対応およびモデル負荷対応ルーティング、キャニーリリース、トークンベースのレート制限を備えています。
  • 高度なスケジューリング:ネットワークトポロジー対応スケジューリングおよび分散推論グループ向けのギャングスケジューリングを含みます。
  • コスト駆動型オートスケーリング:CPU、GPU、メモリメトリクスに基づき、設定可能な予算制約でスケーリングします。
  • 動的LoRA管理:サービス中断なしでアダプターのホットスイッチが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト