llm-d/llm-d-router

llm-d Router: The intelligent entry point for inference requests

解决的问题

解决大型语言模型(LLMs)推理流量高效路由的挑战,通过基于实时信号(如负载、优先级和KV缓存局部性)优化请求放置,从而降低延迟并提高资源利用率。

工作原理

系统由一个名为 llm-d Router 的智能入口组成,该入口结合了代理(如 Envoy)与端点选择器(EPP)。EPP 作为“大脑”,根据推理池的状态评估传入请求以做出路由决策。它通过 ext-proc 协议与代理集成。支持两种部署模式:独立模式(Envoy 和 EPP 部署在同一 Pod 中)或网关模式(与 Kubernetes Gateway API 集成,用于生产级流量管理)。

适用人群

专为管理 LLM 推理基础设施的工程师和运维人员设计,适用于需要高级负载均衡、请求优先级处理以及支持复杂推理生命周期(如 Prefill/Decode 分离)的场景。

核心亮点

  • KV 缓存感知路由:基于缓存局部性优化请求放置。
  • 灵活部署:支持简单独立部署,也支持生产级 Kubernetes Gateway API 集成。
  • 请求管理:提供 API 用于设置调度目标(InferenceObjective)和执行模型名称重写(InferenceModelRewrite),支持 A/B 测试。
  • 支持分离架构:提供侧车组件,用于协调多阶段推理生命周期(Encode/Prefill/Decode)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目