vllm-project/router
A high-performance and light-weight router for vLLM large scale deployment
解決的問題
本專案提供一個高效率、輕量級的請求轉送系統,專為大規模 vLLM 部署設計。它解決了如何有效將進來的請求分發至多個 vLLM 工作者,以最大化吞吐量並優化資源使用效率的問題,特別是在使用預填入-解碼分離等進階部署模式時。
工作原理
路由器作為網關,接收請求並根據可設定的負載平衡策略,將請求轉送至後端 vLLM 工作者。它支援多種路由策略,包括用於會話親和性(KV 快取重用)的一致性雜湊,以及優化前綴快取命中率的快取感知路由。
對於進階設定,它支援「預填入-解碼分離」,路由邏輯專門針對 LLM 推論的獨立處理階段進行處理。它也與 Kubernetes 整合,實現工作進程的自動發現與健康監控,並包含企業級可靠性功能,如電路斷路器與指數退避的重試邏輯。
適用對象
需要高效管理請求分發、確保高可用性,並透過智慧路由優化推論效能的大規模 vLLM 部署之 MLOps 工程師與開發者。
主要特色
- 多樣化的負載平衡:支援輪詢、隨機、兩選一、一致性雜湊與快取感知路由。
- 預填入-解碼分離:針對分離處理階段的專用路由,提升效率。
- Kubernetes 原生支援:內建服務發現與工作進程管理,適用於 K8s 環境。
- 企業級可靠性:包含電路斷路器、重試邏輯與 Prometheus 指標用於監控。
- 高效率:以 Rust 實作,開銷極小。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- 專案