Weave Router 2.0:用於程式設計代理的開源模型路由

Weave Router 2.0 在關鍵的程式設計基準測試中達到了與 GPT-6 Astra 等前沿模型相當的效能,同時顯著降低了營運成本與延遲。透過根據任務複雜度智慧地在 LLM 之間切換——針對複雜系統設計使用高能力模型,針對簡單更新使用輕量級模型——該路由優化了準確性與效率之間的權衡。

效能基準測試

Weave Router 2.0 使用 Terminal Bench 4.0 和 SWE Atlas 針對 GPT-6 Astra 進行了測試。結果顯示,這種整合方法在提供顯著效率提升的同時,達到了與單一前沿模型相同的通過率:

基準測試 通過率 成本對比 Astra 速度對比 Astra
Terminal Bench 4.0 相當 52% 快 2.2 倍
SWE Atlas 相當 54% 快 2.5 倍

技術架構

程式設計代理對話中的路由決策非常複雜,因為一個包含 100 個回合且有 10 個可用模型的典型對話會產生巨大的潛在路徑搜尋空間。為了管理這一點,Weave Router 2.0 採用了三項主要的技術改進:

隱馬可夫模型 (HMM) 與分類器

為了避免透過強化學習 (RL) 完全探索路由空間所帶來的過高成本,該系統使用隱馬可夫模型來追蹤對話狀態。此 HMM 允許路由不僅理解對話的當前狀態,還能理解對話達到該狀態的歷史軌跡。隨後,分類器將此對話狀態映射到相似模型的特定「儲存桶」中,透過消除在給定上下文中不太可能有效的模型,有效地縮減了搜尋空間。

合成資料引導 (Synthetic Data Bootstrapping)

該路由利用前沿 LLM 來標記更大且更多樣化的程式設計代理對話集。這些合成資料用於引導 HMM 和分類器,為路由邏輯的 RL 組件提供更豐富的獎勵訊號。

快取淘汰影響計算

為了最大限度地降低成本,該路由包含一個計算切換模型預期價值的子系統。由於切換模型通常會產生高昂的一次性成本來為新模型重新填充提示快取,因此路由僅在預測使用更強大模型的好處超過快取淘汰成本時才會觸發切換。

社群見解與考量

公告發布後,開發者社群針對模型路由的實作與評估提出了幾項技術考量:

  • 效能上限: 一些使用者質疑,在由前沿模型標記的資料上訓練的路由是否能超越這些模型本身的效能,這表明主要收益是成本降低,而非原始能力的提升。
  • 與現有工具的比較: 使用者建議將該路由與其他多模型系統進行基準測試,例如 Claude Code 的「顧問模式」(Sonnet 5.5 搭配 Fable 顧問) 和 Copilot 的「HydraFusion」系統,特別是在架構規劃和程式碼審查方面。
  • 狀態追蹤: 關於搜尋空間的數學表示法進行了討論,一些人指出路由決策通常是順序性的 (逐回合),而不是預先確定的 100 回合路徑。
  • 快取效率: 人們擔心頻繁切換模型可能會增加非快取輸入 Token 的數量,這可能會影響整體的成本節約聲明。

Weave Router 作為一個開源專案在 GitHub 上提供,並提供託管服務。

Sources

相關