vllm-project/router

A high-performance and light-weight router for vLLM large scale deployment

解决的问题

本项目提供一个高性能、轻量级的请求转发系统,专为大规模 vLLM 部署设计。它解决了如何高效地将传入请求分发到多个 vLLM 工作进程,以最大化吞吐量并优化资源利用率的问题,尤其是在使用预填充-解码分离等高级部署模式时。

工作原理

路由器作为网关,接收请求并根据可配置的负载均衡策略将请求转发到后端 vLLM 工作进程。它支持多种路由策略,包括用于会话亲和性(KV 缓存复用)的一致性哈希,以及优化前缀缓存命中率的缓存感知路由。

对于高级部署场景,它支持「预填充-解码分离」,路由逻辑专门针对 LLM 推理的独立处理阶段进行优化。它还与 Kubernetes 集成,实现工作进程的自动发现和健康监控,并包含企业级可靠性功能,如熔断器和带指数退避的重试逻辑。

适用人群

需要高效管理请求分发、确保高可用性,并通过智能路由优化推理性能的大规模 vLLM 部署的 MLOps 工程师和开发者。

主要亮点

  • 多样化的负载均衡:支持轮询、随机、两选一、一致性哈希和缓存感知路由。
  • 预填充-解码分离:针对分离处理阶段的专用路由,提升效率。
  • Kubernetes 原生支持:内置服务发现和工作进程管理,适用于 K8s 环境。
  • 企业级可靠性:包含熔断器、重试逻辑和 Prometheus 指标用于监控。
  • 高性能:使用 Rust 实现,开销极小。

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • 项目