Agentic 系统中的模型路由:从分类转向优化
Agentic 系统中的模型路由:从分类转向优化
Agentic 系统中的模型路由是一个系统优化问题,而非简单的分类任务。有效的路由需要平衡模型定价、缓存行为、基础设施状态和合规性约束之间的相互作用,从而找到整个系统的最佳运行点。
模型成本的隐藏复杂性
实际的运营成本是由模型、工作负载和提供服务的基础设施之间的相互作用决定的,这使得标价成为路由决策中不可靠的指标。
在对 AppWorld Test Challenge 中 417 个任务进行 CodeAct agent 测试时,Claude Sonnet 4.6 总成本为 79 美元(每个任务 0.19 美元),而 GPT-4.1 的成本为 155 美元(每个任务 0.37 美元)。尽管 GPT-4.1 的 Token 定价更低,且 Sonnet 需要大约三倍的推理步骤,但结果依然如此。这种差异是由缓存驱动的:对于在步骤间重复使用大量上下文片段的 agent 工作负载,Sonnet 更低的缓存读取(cache-read)定价显著降低了实际的输入成本。
为什么任务难度是一个不完整的信号
仅基于估计的任务难度进行路由是行不通的,因为难度在请求开始时往往是不可见的,并且必须与其他生产约束进行权衡。
- 不可见的难度: 一个看似简单的请求,例如“总结这份合同”,可能会触发复杂的内部流程,包括检索、合规性检查和多轮优化,这意味着实际难度只有在执行过程中才会显现。
- 系统性约束: 在企业环境中,路由程序必须在质量和成本之外,还要兼顾数据驻留规则、隐私约束、合规性要求和已批准的模型列表。
超越模型速度的延迟
端到端延迟受基础设施和路由开销的影响,远大于模型本身的原始速度。
主导响应时间的因素包括硬件规格、缓存热度(cache warmth)和端点拥塞。此外,路由的粒度引入了一种权衡:每个任务进行一次路由会增加极小的开销,但在执行的每一步都进行路由会提高灵活性,但代价是更高的运营复杂性和延迟。
转向基于优化的路由方法
将路由视为一个多目标优化问题,可以实现灵活的成本-准确度边界,而不是单一的固定决策。
IBM Research 已从询问“哪个模型最适合这个任务?”转向使用一种能够同时优化成本、质量和延迟的算法。在 AppWorld Test Challenge 上使用 CodeAct agent 进行测试表明,这种方法提供了一系列运行点:
- 延迟优化配置: 以 93 美元和 83 秒的成本实现了 84% 的准确率,与仅使用 Opus 相比,成本降低了 21%,延迟降低了 9%,而准确率仅下降了 4%。
- 效率: 优化过程非常轻量,每个任务大约需要 6 ms 和 2 kB 内存,确保路由程序不会成为系统瓶颈。
与标准的基于难度的路由程序相比(后者可能达到类似的准确率范围,但成本更高),基于优化的方法能更有效地探索完整的权衡空间。
结论:路由即系统优化
模型路由的主要目的不在于为特定任务选择“最佳”模型,而在于为整个系统找到最佳运行点。模型只是缓存行为、基础设施状态和工作负载模式等众多变量中的一个。