vLLM Semantic Router v0.3 Themis 發佈說明

vLLM Semantic Router v0.3 Themis 發佈說明

vLLM Semantic Router v0.3(代號 Themis)將語義路由從可組合的工具轉型為具備狀態化、可觀測性且可投入生產環境的控制平面。本次發佈專注於營運穩定性,提供統一的配置規範以及一個將原始訊號轉化為模型選擇決策的結構化流水線。

規範配置與營運規範

Themis 引入了規範的 config.yaml 結構,以消除不同部署介面(Docker、Helm、Dashboard 和 CRDs)之間重疊的佈局。這種統一的規範確保了無論是在本地還是 Kubernetes 中部署,策略都能保持一致。

關鍵配置變更包括:

  • 統一結構: 配置現在遵循嚴格的結構:versionlistenersprovidersroutingglobal
  • 簡化工作流程: 移除了 vllm-sr init 命令。使用者現在可以使用 vllm-sr serve 進行以儀表板為核心的設定,或直接編寫 config.yaml
  • 遷移路徑: 舊版配置可以使用 vllm-sr config migrate --config old-config.yaml 進行更新。
  • 嚴格驗證: 系統現在會針對未知的 YAML 欄位發出警告,並將 Python CLI 模型與 Pydantic 對齊,以防止靜默的路由漂移。

路由流水線:訊號、投影與決策

Themis 將路由心智模型正式化為五層流水線,以確保路由智能保持可編程與可解釋性。

層級 職責
Signal 從請求、回應、工具、模態、身份或安全分類器中提取證據。
Projection 將原始證據正規化為可供策略使用的概念(例如「緊急程度」或「平衡度」)。
Decision 根據優先級和可解釋條件匹配具名的路由策略。
Algorithm 從匹配決策中的候選模型中選擇一個特定模型。
Model 透過所選的後端別名或提供者提供請求服務。

訊號家族 (Signal Families)

路由器支持廣泛的訊號目錄,包括 authz(角色)、complexity(推理難度)、context(窗口需求)、conversation(工具迴圈形狀)、domain(業務/法律/醫療)、embedding(語義相似度)、event(營運元數據)、fact_check(驗證需求)、jailbreak(注入證據)、kb(知識庫匹配)、keyword(字面/模糊匹配)、language(語言區域)、modality(AR/diffusion/text)、pii(敏感實體)、preference(使用者風格)、reask(不滿意度檢測)、structure(regex/密度)以及 user_feedback(修正請求)。

投影 (Projections)

投影將雜亂的訊號證據轉化為穩定的策略區間。這避免了在多個決策中重複設定低階訊號閾值的需求。Themis 支持三種投影模式:

  • Partitions (分區): 從一個排他性的家族中選擇一個贏家。
  • Scores (評分): 將訊號或 KB 指標組合為連續值。
  • Mappings (映射): 透過校準後的閾值將值轉換為策略區間(例如 support_fastsupport_escalated)。

會話感知代理路由 (Session-Aware Agentic Routing, SAAR)

SAAR 為多輪代理工作負載提供狀態化路由,確保會話連續性,並防止在活躍的工具迴圈期間發生不安全的模型切換。

SAAR 的核心能力包括:

  • 會話記憶 (Session Memory): 由路由器擁有的記憶體,可在不需要獨立會話狀態 DSL 的情況下保留事實與偏好。
  • 連續性規則 (Continuity Rules): 透過權衡品質差距、切換邊際和前綴局部性,評估模型切換是否合理。
  • 硬鎖定 (Hard Locks): 在活躍的工具迴圈或提供者狀態持續期間防止模型切換,以維持穩定性。
  • 診斷 (Diagnostics): 重放記錄保留了會話留在原模型或切換模型的具體推理原因。

協定相容性與硬體支援

擴展的協定支援

Themis 的支援範圍已超越 OpenAI Chat Completions,納入了原生的 Anthropic /v1/messages 入口、具備 OpenAI SSE 轉換的串流,以及自定義的 Anthropic 上游路由。系統使用請求路徑標頭進行協定檢測,並提供回應標頭以指示轉換是否為有損的。

硬體後端路徑

Themis 在四條主要路徑上支持異構推理棧:

  • NVIDIA CUDA & AMD ROCm: 用於提供服務的 vLLM 後端。AMD 路徑已透過 vllm-sr serve --platform amd 驗證。
  • Intel OpenVINO: 一個新的綁定,用於 ModernBERT 序列分類與 embedding 推理的原生 C++ 與 Go 集成。
  • CPU/Local: 用於開發與冒煙測試。

可靠性、可觀測性與效能

長上下文優化

為了降低長上下文路由的成本,Themis 引入了:

  • 線上校準 (Online Calibration): 從觀察到的回應使用情況中學習校準比例,以改進 Token 估計。
  • 分塊注意力 (Chunked Attention): 原生的 mmBERT embedding 路徑現在在查詢分塊中處理注意力,以限制記憶體並防止長輸入被截斷。
  • 提示詞壓縮配置 (Prompt Compression Profiles): 具名的配置(defaultcodingmedicalsecuritymulti_turn)在不改變發送到服務模型的原始提示詞的情況下優化訊號提取。

儲存與可觀測性

本次發佈強化了儲存層,支援 Qdrant 向量搜尋與 Valkey(快取、向量儲存與記憶體)。它還將 O(N) 的 cache-LRU 讀取路徑替換為常數時間的 list-backed 實現,並修復了用於路由器重放的 PostgreSQL 寫入正確性問題。

基準測試

根據 RouterArena 排行榜 的快照,vLLM-SR 已重返第一名,加權 Arena 分數為 75.4,準確率為 76.0%,成本為 每 1K 查詢 $0.11

未來路線圖:v0.4 Hermes

即將推出的 Hermes 版本旨在打造一個「自我改進的路由器」。路線圖專注於閉合 GPU 規模效能研究、DSL 配方調優與編碼器模型微調之間的迴圈,同時進一步收緊 SAAR 的模型切換經濟性,並透過儀表板擴展操作員除錯迴圈。

Sources