kubernetes-sigs/gateway-api-inference-extension
Gateway API Inference Extension
解決的問題
本專案解決在 Kubernetes 上自托管生成式 AI 模型時所面臨的挑戰,透過優化請求路由至模型伺服器的方式。可防止因負載均衡效率不佳所導致的高尾部延遲與吞吐量下降問題,特別是在負載增加時出現 KV 快取淘汰或排隊的情況下。
工作原理
透過使用 Envoy 的外部處理(ext-proc)過濾器,將標準的 Kubernetes Gateway API 相容代理(如 Envoy)轉換為「推理網關」。這使得網關能夠攔截推理請求,並利用端點選擇器(EPP)與推理排程器,根據即時指標與能力(如前綴快取狀態或 LoRA 適配器可用性)將請求路由至最合適的模型伺服器副本。
適用對象
專為在 Kubernetes 上自托管生成式模型(主要是 LLM)並需管理存取權限、優化效能,且在多個 AI 工作負載間維持運營保障的推理平台團隊所設計。
主要亮點
- KV 快取感知路由:透過考慮請求成本與快取狀態的排程演算法,提升吞吐量並降低延遲。
- LoRA 適配器管理:提供 Kubernetes 原生 API,可將請求路由至特定 LoRA 適配器,並管理其發布、A/B 測試與藍綠升級。
- 可插入式架構:支援任何支援 ext-proc 與 Gateway API 的網關,並可透過 llm-d Router 與 vLLM 等模型伺服器整合。
- 運營保障機制:允許多個 GenAI 工作負載安全高效地共用基礎模型伺服器池。
相關
- 專案
- 專案
- 專案
- 專案
- 專案