vllm-project/semantic-router

A programmable Mixture-of-Models router for heterogeneous LLM inference

解決的問題

vLLM Semantic Router 是為了解決 LLM 基礎設施碎片化問題而設計的。與將路由邏輯硬編碼至應用程式不同,它提供了一個可程式化層,讓開發者能管理「模型混合(Mixture-of-Models)」系統。透過根據特定信號與政策,為每個請求選擇最合適的模型路徑,進而優化品質、成本、延遲與隱私。

如何運作

此系統作為路由層,評估請求信號、使用者偏好與應用政策,以選擇或組合模型路徑。它可在異質計算環境之間路由請求,包括 GPU、加速器、邊緣裝置與雲端基礎設施,同時維持資料邊界以確保隱私。

適用對象

適用於在不同硬體與位置(邊緣、私有、雲端)上使用多個模型,並需以可程式化方式管理請求如何路由至這些模型的開發者與組織。

主要特色

  • 可程式化路由: 透過策略執行模型選擇,避免硬編碼邏輯。
  • 異質計算支援: 可在 GPU、加速器、邊緣與雲端的混合環境中路由。
  • 模型混合: 可為不同工作負載組合個人化模型路徑。
  • 隱私感知: 能在路由過程中將資料保留在特定邊界內。

相關