vllm-project/router
A high-performance and light-weight router for vLLM large scale deployment
解决的问题
本项目提供一个高性能、轻量级的请求转发系统,专为大规模 vLLM 部署设计。它解决了如何高效地将传入请求分发到多个 vLLM 工作进程,以最大化吞吐量并优化资源利用率的问题,尤其是在使用预填充-解码分离等高级部署模式时。
工作原理
路由器作为网关,接收请求并根据可配置的负载均衡策略将请求转发到后端 vLLM 工作进程。它支持多种路由策略,包括用于会话亲和性(KV 缓存复用)的一致性哈希,以及优化前缀缓存命中率的缓存感知路由。
对于高级部署场景,它支持「预填充-解码分离」,路由逻辑专门针对 LLM 推理的独立处理阶段进行优化。它还与 Kubernetes 集成,实现工作进程的自动发现和健康监控,并包含企业级可靠性功能,如熔断器和带指数退避的重试逻辑。
适用人群
需要高效管理请求分发、确保高可用性,并通过智能路由优化推理性能的大规模 vLLM 部署的 MLOps 工程师和开发者。
主要亮点
- 多样化的负载均衡:支持轮询、随机、两选一、一致性哈希和缓存感知路由。
- 预填充-解码分离:针对分离处理阶段的专用路由,提升效率。
- Kubernetes 原生支持:内置服务发现和工作进程管理,适用于 K8s 环境。
- 企业级可靠性:包含熔断器、重试逻辑和 Prometheus 指标用于监控。
- 高性能:使用 Rust 实现,开销极小。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目