Weave Router 2.0:面向编程智能体的开源模型路由
Weave Router 2.0 在关键编程基准测试中实现了与 GPT-6 Astra 等前沿模型相当的性能,同时显著降低了运营成本和延迟。通过根据任务复杂度智能切换 LLM——对复杂的系统设计使用高能力模型,对简单的更新使用轻量级模型——该路由优化了准确性与效率之间的权衡。
性能基准测试
Weave Router 2.0 使用 Terminal Bench 4.0 和 SWE Atlas 对比 GPT-6 Astra 进行了测试。结果表明,这种集成方法在提供显著效率提升的同时,达到了与单一前沿模型相当的通过率:
| 基准测试 | 通过率 | 成本对比 Astra | 速度对比 Astra |
|---|---|---|---|
| Terminal Bench 4.0 | 相当 | 52% | 快 2.2 倍 |
| SWE Atlas | 相当 | 54% | 快 2.5 倍 |
技术架构
编程智能体对话中的路由决策非常复杂,因为一个包含 100 轮对话和 10 个可用模型的典型会话会产生巨大的潜在路径搜索空间。为了管理这一点,Weave Router 2.0 采用了三项主要技术改进:
隐马尔可夫模型 (HMM) 与分类器
为了避免通过强化学习 (RL) 完全探索路由空间所带来的高昂成本,系统使用隐马尔可夫模型来追踪会话状态。该 HMM 使路由不仅能理解会话的当前状态,还能理解会话达到该状态的历史轨迹。随后,分类器将此会话状态映射到相似模型的特定“桶”中,通过剔除在给定上下文中不太可能有效的模型,有效地剪枝了搜索空间。
合成数据引导
该路由利用前沿 LLM 对更大且更多样化的编程智能体会话集进行标注。这些合成数据被用于引导 HMM 和分类器,为路由逻辑的 RL 组件提供更丰富的奖励信号。
缓存驱逐影响计算
为了最大限度地降低成本,该路由包含一个计算切换模型预期价值的子系统。由于切换模型通常会产生重新填充新模型提示词缓存的高额一次性成本,因此路由仅在预测使用更强模型带来的收益超过缓存驱逐成本时才会触发切换。
社区见解与考量
公告发布后,开发者社区针对模型路由的实现和评估提出了几点技术考量:
- 性能上限: 一些用户质疑,在由前沿模型标注的数据上训练的路由是否能超越这些模型本身的性能,并指出主要收益在于降低成本而非提升原始能力。
- 与现有工具的对比: 用户建议将该路由与其他多模型系统进行基准测试,例如 Claude Code 的“顾问模式”(Sonnet 5.5 配合 Fable 顾问)和 Copilot 的“HydraFusion”系统,特别是在架构规划和代码审查方面。
- 状态追踪: 关于搜索空间的数学表示存在讨论,一些人指出路由决策通常是顺序的(逐轮进行),而不是预先确定的 100 轮路径。
- 缓存效率: 人们担心频繁切换模型可能会增加非缓存输入 token 的数量,这可能会影响整体的成本节约声明。
Weave Router 作为一个开源项目在 GitHub 上提供,并提供托管服务。
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch