kubernetes-sigs/gateway-api-inference-extension

Gateway API Inference Extension

何を解決するか

このプロジェクトは、Kubernetes上で生成AIモデルを自己ホスティングする際の課題に取り組み、リクエストがモデルサーバーにルーティングされる方法を最適化します。特に負荷が増加する際のKVキャッシュの削除やキューイングによる高尾部遅延やスループットの低下を防ぎます。

動作方法

EnvoyのExternal Processing (ext-proc)フィルタを使用して、標準のKubernetes Gateway API互換プロキシ(例:Envoy)を「インフェンスゲートウェイ」に変換します。これにより、ゲートウェイはインフェンスリクエストをインターセプトし、エンドポイントピッカー(EPP)とインフェンススケジューラを使用して、リアルタイムのメトリクスと能力(例:プレフィックスキャッシュの状態やLoRAアダプタの利用可能状態)に基づいて、最も最適なモデルサーバーのレプリカにリクエストをルーティングできます。

対象ユーザー

Kubernetes上で生成モデル(主にLLM)を自己ホスティングし、アクセス管理、パフォーマンス最適化、複数のAIワークロードにわたる運用ガードレールを維持する必要があるインフェンスプラットフォームチーム向けに設計されています。

主な特徴

  • KVキャッシュ対応ルーティング:リクエストのコストとキャッシュ状態を考慮したスケジューリングアルゴリズムにより、スループットを向上させ、遅延を低減します。
  • LoRAアダプタ管理:KubernetesネイティブAPIを提供し、特定のLoRAアダプタにリクエストをルーティングし、展開、A/Bテスト、ブルーグリーンアップグレードを管理できます。
  • プラグインアーキテクチャ:ext-procとGateway APIをサポートする任意のゲートウェイと連携可能で、llm-d Routerを介してvLLMなどのモデルサーバーと統合できます。
  • 運用ガードレール:複数のGenAIワークロードが基礎モデルサーバーのプールを安全かつ効率的に共有できるようにします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト