vLLM Semantic Router v0.2 Athena 發行說明 / 新功能

vLLM Semantic Router v0.2 Athena 將語意路由從簡單的請求橋樑轉變為混合模型與多代理部署的策略性「系統大腦」。此版本引入了全新重建的模型基礎、用於協調 OpenClaw 系統的實驗性 ClawOS 作業層,以及一個先進的模型選擇框架,支援動態、成本感知與品質感知的路由。

重建的模型基礎與執行時加速

Athena 用統一的長上下文多語言基礎取代了其碎片化的基礎模型架構。系統現在以 mmbert-embed-32k-2d-matryoshka(307M 參數、32K 上下文、支援 1800 多種語言)以及 mom-multilingual-class 分類器系列為核心。

主要模型元件

  • multi-modal-embed-small:一個約 120M 參數的嵌入模型,將文字、影像與音訊映射至共享的 384 維空間,實現跨模態檢索,報告的音訊-文字檢索 R@1 為 36.4%。
  • mmbert-embed-32k-2d-matryoshka:提供具備 32K 上下文與 2D Matryoshka 控制的生產就緒骨幹,允許將向量從 768 維截斷至 256 維,且保留約 99% 的品質。
  • mom-multilingual-class:一個一致的分類器系列,涵蓋五大核心任務:意圖、越獄、個人資訊、事實核查與回饋,提供合併版與 LoRA 版兩種形式。

硬體加速與效能

Athena 實作了模型感知的 ONNX 重寫,並透過 onnx-binding/ort-ck-flash-attn 提供自訂的 ROCm 核心路徑。透過將密集的 SDPA 注意力子圖替換為 com.ck::CKFlashAttention 節點,系統在 AMD Instinct MI300X 硬體上實現了顯著的延遲降低。

延遲比較(ONNX + GPU 與 CPU):

請求大小 ONNX + GPU 平均 ONNX + CPU 平均 Candle + CPU 平均
~500 tokens 22 ms 853 ms 1053 ms
~2000 tokens 31 ms 1814 ms 1805 ms
~8000 tokens 128 ms 4796 ms 1830 ms

Flash Attention 擴展: CK Flash Attention 使系統能處理長度最高達 32K 令牌的序列,先前的 SDPA 路徑會導致記憶體不足(OOM)錯誤。在 4096 令牌時,CK Flash Attention 的速度是 SDPA 的 3.3 倍。

進階模型選擇原語

模型選擇現在是一等一的路由原語,發生於決策匹配之後。Athena 允許系統根據多種策略演算法,為請求選擇特定模型:

  • ML-based Selectors:包括 KNN(歷史查詢相似度)、KMeans(叢集層級模式)、SVM(非線性決策邊界)以及 MLP(透過 Candle 的神經路由器)。
  • Advanced Strategies:包括延遲感知(TPOT/TTFT 資料)、Elo(使用者回饋/Bradley‑Terry 評分)、RouterDC(雙對比相似度)、AutoMix(成本‑品質升級)以及 Thompson Sampling(線上探索/利用)。
  • Reasoning-based:Router‑R1 使用外部路由模型在選擇前對請求進行推理。

ClawOS:OpenClaw 的協調層

ClawOS 是一個實驗性的作業層,讓 Semantic Router 能協調多個 OpenClaw 代理系統。它將路由器的角色從選擇模型轉變為管理多代理環境。主要功能包括:

  • 自然語言 MCP 控制:使用者可透過聊天啟動與管理 OpenClaw 團隊與工作者。
  • 團隊管理:支援明確的領導者與工作者組合,以及共享房間聊天以進行即時協調。
  • 運營可視化:儀表板檢視執行時健康狀態、團隊組成與工作者配置。

核心執行時增強:記憶、RAG 與訊號

狀態與記憶

Athena 將狀態直接整合至核心執行時,新增具備 Milvus 儲存的代理記憶、混合記憶搜尋(結合向量相似度、BM25 與 n-gram 匹配),以及 MINJA 防禦機制以減輕記憶注入攻擊。

擴充的訊號層

訊號層現在支援更廣泛的輸入與匹配路徑:

  • 豐富訊號:新增語言、延遲、上下文、複雜度感知、模態與授權(authz)訊號。
  • 確定性快速路徑:透過加入 BM25、n-gram 模糊匹配與正規表達式,使關鍵字路由不再脆弱,超越僅限精確文字匹配。
  • 安全整合:越獄與個人資訊偵測現在為平行訊號,包含對比式多回合偵測以捕捉逐步升級的攻擊。

基於 NLP 的提示壓縮

為了優化長上下文訊號提取,Athena 引入了確定性的 NLP 流程(使用 TextRank、位置加權、TF‑IDF 與新穎度評分)。此流程僅壓縮用於訊號提取路徑的長提示,而原始完整提示則送至服務模型。基準測試顯示,將 16K 令牌壓縮至 512 令牌時,越獄訊號提取延遲從 127 ms 降至 10 ms。

可程式化設定與部署

神經‑符號設定語言

Athena 推出結合神經訊號提取與符號決策評估的型別化設定語言。此 DSL 具備完整的編譯器與視覺化建構器,讓基於 LLM 的程式編寫代理能從自然語言規格合成路由政策。

AMD ROCm 一等一支援

AMD ROCm 現已成為標準部署路徑。vllm-sr serve --platform amd 指令可啟用 ROCm 映像預設、GPU‑優先設定,以及載入 AMD CK Flash Attention 自訂運算子。

零設定上線

安裝流程透過 macOS 與 Linux 的單行安裝程式簡化,將體驗從 YAML 為先轉為儀表板為先的上線流程,使用者可自動啟動最小工作空間。

Sources