kubernetes-sigs/gateway-api-inference-extension

Gateway API Inference Extension

解决的问题

该项目解决了在 Kubernetes 上自托管生成式 AI 模型时面临的挑战,通过优化请求路由到模型服务器的方式。它可防止因低效的负载均衡导致的高尾部延迟和吞吐量下降问题,尤其是在负载增加时出现 KV 缓存淘汰或排队的情况下。

工作原理

通过使用 Envoy 的外部处理(ext-proc)过滤器,将标准的 Kubernetes Gateway API 兼容代理(如 Envoy)转换为「推理网关」。这使得网关能够拦截推理请求,并利用端点选择器(EPP)和推理调度器,根据实时指标和能力(如前缀缓存状态或 LoRA 适配器可用性)将请求路由到最合适的模型服务器副本。

适用人群

专为在 Kubernetes 上自托管生成式模型(主要是 LLM)并需要管理访问权限、优化性能、在多个 AI 工作负载间维持运营保障的推理平台团队设计。

主要亮点

  • KV 缓存感知路由:通过考虑请求成本和缓存状态的调度算法,提升吞吐量并降低延迟。
  • LoRA 适配器管理:提供 Kubernetes 原生 API,可将请求路由到特定 LoRA 适配器,并管理其发布、A/B 测试和蓝绿升级。
  • 可插拔架构:支持任何支持 ext-proc 和 Gateway API 的网关,并可通过 llm-d Router 与 vLLM 等模型服务器集成。
  • 运营保障机制:允许多个 GenAI 工作负载安全高效地共享基础模型服务器池。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目