代理人系統中的模型路由:從分類到優化的轉變
代理人系統中的模型路由:從分類到優化的轉變
代理人系統中的模型路由是一個系統優化問題,而非簡單的分類任務。有效的路由需要平衡模型定價、快取行為、基礎設施狀態與合規限制之間的互動,以找到整個系統的最佳運作點。
模型成本的隱藏複雜性
實際運營成本由模型、工作負載與服務基礎設施的互動決定,使得標價成為路由決策不可靠的指標。
在使用 CodeAct 代理人於 AppWorld 測試挑戰的 417 個任務進行的測試中,Claude Sonnet 4.6 總成本為 79 美元(每任務 0.19 美元),而 GPT-4.1 成本為 155 美元(每任務 0.37 美元)。儘管 GPT-4.1 的 token 定價較低,且 Sonnet 需要大約三倍的推理步驟,但仍出現此情況。差異源於快取:Sonnet 的低快取讀取定價顯著降低了代理人工作負載在步驟間重複使用大塊上下文時的有效輸入成本。
為什麼任務難度是不完整的信號
僅根據估計的任務難度進行路由會失敗,因為難度通常在請求開始時是不可見的,必須與其他生產限制取得平衡。
- 不可見的難度: 看似簡單的請求,例如「總結此合約」,可能會觸發包括檢索、合規檢查和多輪細化在內的複雜內部流程,意味著實際難度僅在執行期間才顯現。
- 系統限制: 在企業環境中,路由器必須在資料駐留規則、隱私限制、合規需求和已批准模型清單之外,同時平衡品質與成本。
模型速度以外的延遲
端到端延遲更受基礎設施和路由開銷的影響,而非模型本身的原始速度。
主導響應時間的因素包括硬體規格、快取暖度和端點擁塞。此外,路由的細緻度引入了一種權衡:每項任務僅路由一次會增加極少的開銷,但對執行的每個步驟進行路由則會提高靈活性,同時帶來更高的運營複雜度和延遲。
轉向基於優化的路由方法
將路由視為多目標優化問題,可彈性地形成成本-準確性前沿,而非單一固定決策。
IBM Research 從詢問「哪個模型最適合此任務?」轉向同時優化成本、品質與延遲的演算法。在使用 CodeAct 代理人對 AppWorld 測試挑戰進行的測試表明,此方法提供了一系列運作點:
- 延遲優化配置: 以 93 美元和 83 秒達成 84% 準確率,相較於單獨使用 Opus,這代表成本降低 21%、延遲降低 9%,僅準確率下降 4%。
- 效率: 優化過程輕量級,每項任務僅需約 6 毫秒和 2 kB 記憶體,確保路由器不會成為系統瓶頸。
與標準難度基礎路由器相比,後者可能在相似準確率範圍內但成本更高,基於優化的方法能更有效地探索完整的權衡空間。
結論:將路由視為系統優化
模型路由主要不是為特定任務選擇「最佳」模型,而是為整個系統尋找最佳運作點。模型僅是快取行為、基礎設施狀態與工作負載模式中的一個變數。