vLLM Semantic Router 多模態路由與視覺編碼器強化
vLLM Semantic Router 多模態路由與視覺編碼器強化
vLLM 已擴展 Semantic Router (VSR) 以支援多模態路由,允許來自圖像、螢幕截圖和文件的視覺證據,在與文本相同的決策架構中作為類型化信號(typed signals)發揮作用。這次轉型將 VSR 從提示詞層級(prompt-level)路由提升到請求層級(request-level)策略,能夠根據多模態請求的實際內容進行更精確的路由。
多模態路由作為請求層級策略
VSR 中的多模態路由並非簡單的圖像分類;它是將視覺信號整合到「信號-決策」(Signal-Decision)架構中。在此模型中,信號是獨立的觀察結果,透過優先級和布林邏輯進行組合,以決定路由路徑。
透過分析完整的請求而非僅僅是文本提示詞,VSR 現在可以處理文本內容泛泛,但圖像包含決定性證據的情境。例如:
- PII 風險: 一個說著「總結這個」並配有護照圖像的請求,會被路由為具有受限處理要求的身份證件。
- 領域專業化: 一個模糊的問題如「這顯示了什麼?」配上胸部 X 光片,會觸發醫療領域策略並路由到具備能力的視覺語言模型 (VLM)。
- 安全性審查: 一個「找出錯誤」的提示詞配上程式碼截圖,會被識別為程式碼人工產物,觸發安全性審查路徑和機密洩漏檢查。
- 領域外拒絕: 一個醫療提示詞配上不相關的汽車圖像,會被標記為領域外視覺證據,導致澄清或拒絕路徑。
解決視覺信號反轉問題
在使用 multi-modal-embed-small (mmes) 編碼器實作多模態路由期間,vLLM 發現了一個關鍵錯誤,即部署的路徑出現了「自信的錯誤」。一個橫跨三個垂直領域、包含 11 張圖像的探測實驗顯示了 82% 的反轉率,即信號呈現反相關而非僅僅是噪聲(例如:醫療 X 光片的排名比醫療相關候選者更接近半導體候選者)。
誤診:編碼器強度
最初的假設認為緊湊的 multi-modal-embed-small 編碼器不足以完成任務。然而,測試顯示其他模型——包括 SigLIP2-base、SigLIP-base (透過 Hugging Face) 以及較大的 multi-modal-embed-large (mmEL)——在相同的探測中都獲得了 10/10 的評分。關鍵的是,透過 PyTorch 參考路徑加載的 mmes 模型也獲得了 10/10,證明編碼器本身並非問題所在。
根本原因:實作漂移
調查發現 PyTorch 參考路徑與 Rust/Candle 綁定路徑之間存在顯著差異。一個護照固定測試顯示,PyTorch 中的餘弦相似度為 0.7204,而 Candle 綁定路徑中僅為 0.1576。
在 Candle 路徑中識別並修正了三個具體的實作錯誤:
- Pooling Head 不匹配:
SigLIPVisionEncoder::forward的實作使用了 BERT 風格的 mean + Linear + tanh pooling,而非要求的 attentional probe pooling head。這已在 PR #1927 中解決。 - 歸一化錯誤: Go 圖像加載器提供的像素值範圍為
[0, 1],但 SigLIP 需要逐通道歸一化(x - 0.5) / 0.5。這已在 PR #1928 中修復。 - 預處理漂移: Go 端的 resize 路徑使用了 4-tap bilinear 實作,與 PyTorch 參考中的 PIL 風格預處理不同。PR #1943 將圖像解碼、縮放和轉換移至 Rust,並使用
imagecrate 搭配 Catmull-Rom 濾波器,以模擬 PIL bicubic + antialias 的行為。
驗證與效能
在這些修復之後,生產路徑已針對 PyTorch 參考進行了驗證。對護照固定件進行的三向量隔離實驗顯示,完整的分支堆疊流水線與參考值的餘弦相似度達到了 0.999902。
在 20 張圖像的語料庫中,系統達到了最小餘弦值 0.999557 和平均值 0.999919,其中 20/20 張圖像對 PyTorch 參考的評分 $\ge 0.999$。
關於效能,VSR 中的分類器信號透過 runSignalDispatchers 並行運行,這意味著牆鐘延遲(wall-clock latency)受限於最慢的啟用分類器。在具代表性的追蹤中,完整的分類決策在 CPU 上大約 1.3 秒內完成。
VSR 未來路線圖
隨著可靠視覺信號路徑的建立,vLLM 打算將 VSR 演進為一個全面的請求層級控制平面。未來的架構目標包括:
- 將圖像衍生的信號直接整合到與文本信號相同的決策層中。
- 確保多模態決策在重放(replay)、指標(metrics)和調試工具中是可見的。
- 使模型選擇能夠同時感知策略匹配度和模態能力。
- 對 PII 和越獄(jailbreak)等安全性關鍵信號保持高保真度檢查。
- 將路由架構擴展到代理工作流(agentic workflows),包括工具調用和記憶體寫入。