超越單一模型:使用 vLLM Semantic Router 構建 Mixture-of-Models 系統

超越單一模型:使用 vLLM Semantic Router 構建 Mixture-of-Models 系統

TL;DR

vLLM Semantic Router 現在支援 Mixture-of-Models (MoM) 系統,將破碎的模型、運算、位置與偏好挑戰,轉化為一個內部的模型系統,在幕後協調獨立模型,同時呈現單一的版本化模型身份。

背景與動機

模型、運算、位置與使用者偏好的碎片化,迫使每個應用程式都必須自行協調這些差異。將模型邊界擴展到包含智能分配,可以使分配成為模型的一部分,將碎片化限制在系統內部。

vLLM Semantic Router 的演進

從 2025 年 4 月的孵化階段到 2026 年 6 月的 Themis 版本,vLLM‑SR 從簡單的意圖感知路由,演進到具備投影 (projections)、重放 (replay) 與協定支援的狀態感知會話控制。Iris 版本引入了可組合的路由與 MoM 模型家族;Athena 增加了模型選擇、記憶體、RAG、多模態與操作儀表板;Themis 則將系統轉化為一個可操作的合約,具備會話感知代理路由 (session‑aware agentic routing)、可重放的追蹤 (replayable traces) 以及跨硬體支援。

什麼是 Mixture-of-Models

Mixture-of-Models 是一種版本化的複合模型,其引擎透過跨越獨立模型與算子的、以偏好為條件且受資源限制的路徑,來實現每個請求,並透過單一模型介面呈現並回傳一個具備歸屬性的結果。與 Mixture‑of‑Experts (MoE) 不同,MoM 協調的是在架構、所有者、授權、模態、協定、上下文窗口與硬體方面可能各異的獨立模型;一個 MoE 檢查點 (checkpoint) 可以是 MoM 的一個組成部分。

方面 傳統模型 Mixture-of-Models
智能單元 單一檢查點 一個受管理的模型系統
專業化 主要編碼在權重中 透過獨立專家進行組合
執行 單一生成路徑 選擇、級聯、驗證、融合或工作流
優化目標 單一模型的品質與效率 跨品質、成本、延遲、安全性、隱私與能源的系統前沿
部署邊界 單一執行環境 雲端、資料中心與邊緣
使用者合約 單一模型身份 單一模型身份

為什麼模型邊界必須移動

模型、運算、位置與使用者偏好各自都是碎片化的;沒有單一模型能在所有維度上勝出。今天,每個應用程式都必須將這些碎片黏合在一起。MoM 將這項責任移至單一模型邊界之後,使智能分配成為模型的一部分,讓應用程式只需面對單一模型身份,而系統在內部進行工作路由、應用策略並協調模型。

MoM 的四個平面

一個完整的 MoM 跨越四個平面:構件 (artifact)、學習 (learning)、執行 (execution) 與物理實現 (physical realization)。

  • Artifact 擁有組件、能力、目標、策略、評估合約與來源;vLLM‑SR 中已有的基礎包括標準配置、模型引用、DSL、版本化策略;下一步是可移植的 MoM 導入/匯出規範。
  • Learning 擁有路由擁有的模型、偏好、結果與配方改進;基礎包括訓練棧、Router Learning、重放與結果 API;下一步是聯合訓練與系統級發布閘門。
  • Execution 擁有信號、投影、決策、選擇器、循環器與插件;基礎包括 Signal–Decision 執行環境、Fusion、ReMoM、工作流、安全性與記憶體;下一步是一個具備生命週期感知能力的 MoM 引擎。
  • Physical 擁有供應商、模型池、加速器、在地性、快取與能源狀態;基礎包括 vLLM 後端、雲端供應商、ROCm、CUDA、OpenVINO、CPU;下一步是在雲端、資料中心、邊緣與本地設備之間進行可移植的配置。

部署使用四個對象:bundle(固定介面、圖形、策略、行為變體、邊界、不可變的語義資產)、binding(將邏輯組件映射到合格的部署而不改變決策語義)、resolution lock(凍結組成版本、執行環境、鏡像、加速器、供應商觀察結果)以及 run record(將每個決策、呼叫、約束檢查、成本與結果歸屬於 bundle、binding 與 lock)。

vLLM‑SR 作為 MoM 引擎

訓練、評估與推論必須共享同一個合約;否則研究、基準測試與生產環境會產生偏差。

訓練是分配,而不僅是權重

MoM 訓練涵蓋路由擁有的嵌入 (embeddings)、信號編碼器、偏好與安全性模型以及選擇器。它還學習分配與協作:哪條路徑符合工作負載與預算、何時應停止級聯、面板應如何判斷或綜合,以及代理會話何時應切換模型。進度可以從追蹤與結果中進行優化,而不需要透過所有組成部分進行梯度傳播。

將 MoM 作為單一模型進行評估

評估必須對模型身份進行端到端評分;後端基準測試是輸入,而非結果。版本化的評分卡應衡量路由遺憾 (routing regret)、協作增益、恢復能力、會話連續性、尾端延遲、成本、安全性、隱私與能源。它應該測試供應商故障、設備遺失、模型分歧、工作負載漂移與偏好變化。每個宣告的運行點都需要自己的測試:flash 測試其延遲–品質前沿,light 測試其品質底線,而 ultra 則在預算範圍內測試。

在推論時執行智能

在推論時,引擎決定單一模型是否足夠。它可能會選擇一個本地專家、保留熱會話、透過置信度級聯進行升級、要求檢索或驗證、運行一個 Fusion 面板,或執行一個受限的工作流。執行環境擁有預算、拓撲、回退、追蹤與回應合約;應用程式只需進行正常的模型呼叫。

一個可以移動的模型

目標是建立一個完整的 MoM,可以作為統一模型進行構建、匯出、匯入、版本化、評估、部署與調用。一個邏輯規範可以編譯成一個不可變的 bundle,綁定到環境,解析具體的部署,並在服務與評估時保留相同的身份。

當物理實現改變時,該構件應能在開發者機器、私有集群、雲端集群與邊緣環境中運行。該專案已支援跨越 ROCm、CUDA、OpenVINO 與 CPU 的路徑;硬體能力與配置將成為 MoM 合約的一部分。

使用者的體驗標準很簡單:

單一模型身份。多個模型。任何硬體。

現在有哪些變化

下一階段將集中在四個關聯領域:

  1. 定義一個可移植的 MoM 規範,將組件、目標、策略、偏好、評估、約束與執行語義封裝為一個版本化的構件。
  2. 透過從評估與重放中改進模型與配方,來完成訓練–評估–推論的循環,然後透過可審核、可回滾的發布進行交付。
  3. 構建一個異構執行環境,將一個 MoM 映射到雲端、資料中心與邊緣,並以硬體、在地性、能源與數據邊界作為輸入。
  4. 保持模型介面簡單乏味,使得 MoM 像單一模型一樣易於匯入、部署與調用。

與我們一起構建

構建 Mixture‑of‑Models 需要在模型訓練、評估、服務系統、硬體與生產營運方面進行工作。該專案在學習分配、偏好優化、模型協作、能源感知推論、可移植構件、開放評估與異構執行環境方面尋求貢獻。

如果您正在研究這些問題,我們希望從您的工作負載與測量中學習。構建一個運行點、增加一個執行環境、測試一個協作配方,或發布一個組合失敗的案例。

致謝名單列出了幫助塑造該專案的貢獻者與協作者,包括來自 MBZUAI、McGill University、Mila、Rice University 以及許多公司與開源社群的工程師。該專案已有 1,734 個提交 (commits) 與 150 多位貢獻者。

在 GitHub 上加入我們,探索文件,在 Hugging Face 上嘗試 MoM 模型家族,並在 vLLM Slack 的 #semantic‑router 頻道中與社群交流。

vLLM Semantic Router 起初是幫助基礎設施為每個請求選擇正確的模型。現在我們正在將該基礎擴展到單一模型之外:邁向能夠跨設備與環境協調、評估與操作多個模型的系統。

我們邀請社群在公開環境下協助構建與測試該方法。

Sources