llm-d/llm-d-router
llm-d Router: The intelligent entry point for inference requests
解决的问题
解决大型语言模型(LLMs)推理流量高效路由的挑战,通过基于实时信号(如负载、优先级和KV缓存局部性)优化请求放置,从而降低延迟并提高资源利用率。
工作原理
系统由一个名为 llm-d Router 的智能入口组成,该入口结合了代理(如 Envoy)与端点选择器(EPP)。EPP 作为“大脑”,根据推理池的状态评估传入请求以做出路由决策。它通过 ext-proc 协议与代理集成。支持两种部署模式:独立模式(Envoy 和 EPP 部署在同一 Pod 中)或网关模式(与 Kubernetes Gateway API 集成,用于生产级流量管理)。
适用人群
专为管理 LLM 推理基础设施的工程师和运维人员设计,适用于需要高级负载均衡、请求优先级处理以及支持复杂推理生命周期(如 Prefill/Decode 分离)的场景。
核心亮点
- KV 缓存感知路由:基于缓存局部性优化请求放置。
- 灵活部署:支持简单独立部署,也支持生产级 Kubernetes Gateway API 集成。
- 请求管理:提供 API 用于设置调度目标(InferenceObjective)和执行模型名称重写(InferenceModelRewrite),支持 A/B 测试。
- 支持分离架构:提供侧车组件,用于协调多阶段推理生命周期(Encode/Prefill/Decode)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目