vLLM Semantic Router:透過微代理協作提升模型性能
vLLM Semantic Router:透過微代理協作提升模型性能
vLLM 推出了 Semantic Router,這是一種服務層原語(serving-layer primitive),允許單次模型 API 調用觸發多個模型的受限協作,有效地將模型團隊視為單一模型身份。這種方法透過選擇特定任務的協作「配方」(recipes),使系統能夠匹配或超越前沿模型(frontier models)的性能,而無需應用層管理複雜的代理圖(agent graphs)。
作為能力層的 Semantic Router
vLLM Semantic Router 並非僅作為後端的被動傳遞,而是作為一個主動的控制平面。它將路由器的傳統角色——先前專注於成本降低、安全策略執行和雲端-邊緣協調——轉變為構建能力的工具。
透過使用穩定的模型身份(例如 vllm-sr/auto),路由器可以執行複雜的內部流程——包括向工作節點擴展(fanning out)、收集法定人數(collecting quorums)、驗證分歧以及綜合最終答案——同時向用戶返回標準的 OpenAI 相容響應。這將多模型協作的複雜性從應用層抽象化,並移至服務基礎設施中。
Looper:微代理的執行運行時
Semantic Router 的核心是「looper」,這是一個管理受限微代理(micro-agents)的運行時。當請求進入路由器時,它會被投影到任務形狀或風險帶中,以決定適當的 looper 演算法。主要的 looper 模式包括:
- Confidence:一種具備成本意識的序列升級循環。它首先嘗試較便宜的模型,只有當置信度分數(源自對數機率、自我驗證或蘊含驗證器)低於特定閾值時,才會升級到更昂貴的候選模型。
- Ratings:一種受控的集成循環,會並行啟動多個候選模型,最高達到
max_concurrent上限,並使用評分感知權重來聚合結果。 - ReMoM (Repeated Mixture-of-Model):一種專注於推理的循環,會擴展多次嘗試,等待最小成功法定人數,並使用綜合模型將證據合併為最終輸出合約。
- Fusion:一種將分歧視為信號的模式。獨立的專家回答會提供給裁判(judge)和定稿者(finalizer),由其分析矛盾點和獨特見解,以產生最終響應。
- Workflows:一種受限的代理運行時,支持靜態角色或動態規劃器。它在步驟、並行性和超時方面的嚴格限制內執行工作步驟,以確保系統受基礎設施治理,而不是變成無限制的自主代理。
優化性能的任務型配方
性能的提升是透過將協作模式與特定任務的需求相匹配來實現的。vLLM 主張最佳的循環是「任務形狀化」(task-shaped)的,這意味著不同的基準測試需要不同的配方:
- GPQA-Diamond:針對困難的科學複選題,使用 ReMoM 配方並嚴格保留
ANSWER: X格式。 - LiveCodeBench:採用代碼形狀化循環,評估約束條件、啟動代碼和隱藏測試風險。
- Humanity's Last Exam (HLE):根據形式推理和分歧風險,在更深層的 ReMoM、較小的 Fusion 或回退路徑之間進行選擇。
基準測試性能
評估顯示,路由器主導的協作可以創造出比任何單一模型調用都更強大的模型身份。以下結果比較了 VSR Closed(僅使用閉源模型後端)和 VSR Hybrid(混合開源與閉源模型):
| 基準測試 | VSR Row | 分數 | 參考基準 |
|---|---|---|---|
| LiveCodeBench (Jan-Apr 2025) | VSR Closed | 92.6 | Fugu Ultra (92.0), GPT-5.5 (90.7), Opus 4.8 (90.3) |
| GPQA-Diamond | VSR Closed | 96.0 | Fugu Ultra (95.5), Gemini 3.1 Pro (94.3), GPT-5.5 (93.6) |
| Humanity's Last Exam | VSR Closed | 50.0 | Fugu Ultra (50.0), Gemini 3.1 Pro (45.0) |
| Humanity's Last Exam | VSR Hybrid | 47.1 | Qwen3.7 Max (41.4), GPT-5.5 (41.4) |
對模型服務基礎設施的啟示
這種轉變將模型服務從被動堆疊轉向主動堆疊。路由器現在管理微代理編排的核心組成部分:模型別名、供應商策略、憑證、成本元數據和響應語義。透過將這些能力整合到服務層,vLLM 使系統能夠在無需更改客戶端集成的情況下,提高其推理能力和效率。