Kimi K3 和 Fable 5:通过模型路由实现最先进的性能

Kimi K3 和 Fable 5:通过模型路由实现最先进的性能

在开源权重模型 Kimi K3 与闭源模型 Fable 5 之间进行任务路由,可以在智能体任务上实现 93% 的准确率,表现优于单独使用任何一个模型。这种方法在处理长智能体循环时,比仅依赖 Fable 5 的成本效益高出多达 50 倍,这表明混合使用专业化模型比使用单一的前沿模型更高效。

模型路由优于单模型架构

使用路由程序将任务引导至最适合特定工作负载的模型,其整体质量比使用任何单一模型都要高。在一项针对约 1,000 个智能体任务的研究中,“先知路由”(oracle router)——一个在将任务通过所有可用模型运行后选择最便宜且正确的选项的理论上限——证明了 K3 和 Fable 5 的组合系统性能超过了任何单一模型。

先知路由在所有任务中选择了 Kimi K3 达 72% 至 96%,这表明高性能路由程序可以利用最具成本效益的模型来处理绝大多数工作负载,同时保持前沿水平的质量。

性能对比:Kimi K3 vs. Fable 5

虽然 Kimi K3 和 Fable 5 显示出相似的顶尖准确率,但它们在不同领域表现出截然不同的优势:

  • 软件工程 (SWE): 两个模型几乎持平,K3 达到 92.4%,Fable 5 达到 92.6%。然而,K3 在符号数学和开发工具方面表现出色,而 Fable 5 在 Web 和数据可视化方面更强。
  • 终端操作: 在涉及 Shell 驱动和系统探测的长程智能体工作中,Kimi K3 显著优于 Fable 5。K3 成功完成了涉及 7z hashes、FEAL cryptanalysis、泄露的 secrets 以及实时漏洞的任务,而 Fable 5 则无法解决。
  • 多语言编程: Fable 5 在广度上保持领先,特别是在 Java、Python 和 C++ 方面,而 K3 在 JavaScript 和 Rust 方面具有竞争力。
  • 法律与算法任务: K3 在法律智能体基准测试和算法问题解决方面显示出竞争优势。

成本效益与 Prompt Caching 的作用

在所有五个测试的任务族中,Kimi K3 一致地比 Fable 5 更具成本效益。成本差距由三个主要因素驱动:token 价格、prompt caching 和单任务投入。

在 SWE 任务中,与 Fable 5(21 轮对话和 130K tokens)相比,K3 通常需要更多的轮次(约 55 轮对话和 1.3M tokens)。尽管 token 数量更高,但 prompt caching 使得 K3 保持了更低的成本。相反,在终端任务中,Fable 5 往往会陷入“螺旋式下降”,消耗更多 token(高达 1.5M tokens)和轮次(64 轮对话),经常导致超时,而 K3 则保持了更高的效率。

社区观点与批判性分析

行业从业者和观察者针对这些发现提出了几点看法:

"文章讨论的是通过完美的路由程序理论上可以达到的最佳效果。结论是,尝试构建一个优秀的路由程序是值得的。但它不太可能是一个完美的路由程序。"

批评者指出,结果是基于“先知路由”的,这代表了一个理论最大值,而非生产环境可用的实现。一些用户对报告的偏见表示怀疑,指出该报告是由一家托管开源模型的推理提供商发布的。此外,一些人强调了地缘政治背景,认为中国的硬件限制迫使中国实验室开发出比美国实验室更具成本效益的模型。

此外,还有关于文中描述的路由程序的可访问性,以及如果模型无法在本地运行,它们是否真的“开源”的担忧。一些用户还指出,这项研究的结果可能与 arena.ai 等通用排行榜不同,在 arena.ai 上,Fable 5 被报告在更多类别中占据主导地位。

Sources