vllm-project/semantic-router
A programmable Mixture-of-Models router for heterogeneous LLM inference
解決的問題
vLLM Semantic Router 是為了解決 LLM 基礎設施碎片化問題而設計的。與將路由邏輯硬編碼至應用程式不同,它提供了一個可程式化層,讓開發者能管理「模型混合(Mixture-of-Models)」系統。透過根據特定信號與政策,為每個請求選擇最合適的模型路徑,進而優化品質、成本、延遲與隱私。
如何運作
此系統作為路由層,評估請求信號、使用者偏好與應用政策,以選擇或組合模型路徑。它可在異質計算環境之間路由請求,包括 GPU、加速器、邊緣裝置與雲端基礎設施,同時維持資料邊界以確保隱私。
適用對象
適用於在不同硬體與位置(邊緣、私有、雲端)上使用多個模型,並需以可程式化方式管理請求如何路由至這些模型的開發者與組織。
主要特色
- 可程式化路由: 透過策略執行模型選擇,避免硬編碼邏輯。
- 異質計算支援: 可在 GPU、加速器、邊緣與雲端的混合環境中路由。
- 模型混合: 可為不同工作負載組合個人化模型路徑。
- 隱私感知: 能在路由過程中將資料保留在特定邊界內。
相關
- 專案
- Dispatch
- 專案
- 專案
- Dispatch