kubernetes-sigs/gateway-api-inference-extension
Gateway API Inference Extension
何を解決するか
このプロジェクトは、Kubernetes上で生成AIモデルを自己ホスティングする際の課題に取り組み、リクエストがモデルサーバーにルーティングされる方法を最適化します。特に負荷が増加する際のKVキャッシュの削除やキューイングによる高尾部遅延やスループットの低下を防ぎます。
動作方法
EnvoyのExternal Processing (ext-proc)フィルタを使用して、標準のKubernetes Gateway API互換プロキシ(例:Envoy)を「インフェンスゲートウェイ」に変換します。これにより、ゲートウェイはインフェンスリクエストをインターセプトし、エンドポイントピッカー(EPP)とインフェンススケジューラを使用して、リアルタイムのメトリクスと能力(例:プレフィックスキャッシュの状態やLoRAアダプタの利用可能状態)に基づいて、最も最適なモデルサーバーのレプリカにリクエストをルーティングできます。
対象ユーザー
Kubernetes上で生成モデル(主にLLM)を自己ホスティングし、アクセス管理、パフォーマンス最適化、複数のAIワークロードにわたる運用ガードレールを維持する必要があるインフェンスプラットフォームチーム向けに設計されています。
主な特徴
- KVキャッシュ対応ルーティング:リクエストのコストとキャッシュ状態を考慮したスケジューリングアルゴリズムにより、スループットを向上させ、遅延を低減します。
- LoRAアダプタ管理:KubernetesネイティブAPIを提供し、特定のLoRAアダプタにリクエストをルーティングし、展開、A/Bテスト、ブルーグリーンアップグレードを管理できます。
- プラグインアーキテクチャ:ext-procとGateway APIをサポートする任意のゲートウェイと連携可能で、llm-d Routerを介してvLLMなどのモデルサーバーと統合できます。
- 運用ガードレール:複数のGenAIワークロードが基礎モデルサーバーのプールを安全かつ効率的に共有できるようにします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト