深入了解 VAKRA:智能体的推理、工具使用与失败模式

深入了解 VAKRA:智能体的推理、工具使用与失败模式

概述

VAKRA 是一个基于工具且可执行的基准测试,通过要求智能体在 API 和文档之间进行组合推理,来衡量其在类企业环境中的推理和行动能力。它的重要性在于揭示了表面层面的工具能力与可靠的端到端智能体行为之间的差距,表明即使是强大的模型在处理多步工作流时也经常失败。

任务描述

VAKRA 包含四种能力,每种能力都在一个可执行环境中测试一组独特的技能,该环境拥有跨越 62 个领域、超过 8,000 个本地托管的 API 以及领域相关的文档集合。

能力 1:使用商业智能 API 进行 API 链式调用

该能力包含分布在 54 个领域中的 2,077 个测试实例,要求智能体从 SLOT-BIRD 和 SEL-BIRD 集合中链式调用 1-12 个工具,从而从 JSON 数据源中得出答案。每个实例都以一个 get_data(tool_universe_id=id) 调用开始,该调用用于初始化数据源并配置 MCP 服务器以公开相应的工具集。

能力 2:使用仪表板 API 进行工具选择

该能力包含分布在 17 个领域中的 1,597 个实例,使用通过 FastAPI 封装并由 MCP 服务器提供的扩展 REST-BIRD 集合(端点风格 API)。智能体必须从每个领域包含 6 到 328 个工具(平均 116 个)的特定领域集合中选择正确的 API。OpenAI API 规范将工具列表限制为 128 个,因此需要一种筛选机制。

能力 3:使用仪表板 API 进行多跳推理

能力 3 部分包含从 38 个学科领域中提取的 869 个测试实例,同样依赖于 REST-BIRD API 集合,但增加了多跳推理。问题需要一到五个逻辑跳跃,每次跳跃都涉及从 API 调用中提取并结合支持性证据。

能力 4:多跳、多源推理与策略遵循

能力 4 包含分布在 41 个领域中的 644 个实例,构建在 REST-BIRD API 集合的基础上,并增加了每个领域的文档索引、多轮对话和可选的工具使用策略。查询可能需要来自 API、文档检索器或两者的结合(API-RAG-API 模式)的信息。策略是纯文本指令,限制了智能体在给定轮次中可以使用哪些知识源。

评估框架

VAKRA 通过评估最终答案的正确性和完整工具执行轨迹的有效性来评估智能体,奖励通过有效推理过程获得正确答案的智能体。

评估指标

VAKRA 评估器对预测的最终响应和相应的工具调用轨迹进行操作,在与基准真相(ground truth)相同的环境中执行预测的调用,以验证中间输出。评估遵循瀑布式流水线:对于能力 4 任务,首先检查策略遵循情况;然后将预测的工具调用序列与基准真相进行比较;只有具有有效轨迹的样本才会进入最终响应评估。

工具序列的正确性通过执行每个预测的工具并将其工具响应集与基准真相的响应集进行比较来确定,允许替代但有效的调用。如果检查结果不确定,则使用改编自 CRAG 框架的基于 LLM 的评估来确定预测的轨迹尽管存在结构差异是否检索到了所有所需信息。最终响应由 LLM 判断,以确保其基于预测的工具输出并与基准真相答案在事实上一致。

分数按能力计算并在排行榜中取平均值:排行榜分数 = (能力₁ + 能力₂ + 能力₃ + 能力₄) / 4。能力 1-3 是正确查询的简单平均值;能力 4 对多源正确查询的权重是仅 API 或仅 RAG 正确查询的两倍。

错误分析

错误分析使用阶段性分类,将每次失败归因于第一个崩溃点:工具选择、参数提供、参数值或最终响应落地。

失败阶段隔离

通过将每个实例分类到最早的失败阶段,错误被视为数据集的互斥部分,避免了重复计算并提供了可解释的细分。

能力 1:使用商业智能 API 进行 API 链式调用

对于该能力中的 2,077 个样本,GPT-OSS-120B 明显优于其他模型,这主要是由于对工具 Schema 更好的理解以及在填充可选参数方面的鲁棒性。SLOT-BIRD(1,477 个样本)的错误主要表现为除 GPT-OSS-120B 以外的所有模型都出现了错误的工具参数名称,而 SEL-BIRD(600 个样本)表现出较少的参数错误,但由于工具集更大且具有动态性,出现了更多的工具选择错误。

能力 2:使用仪表板 API 进行工具选择

在 1,597 个样本中,Gemini-3-flash-preview 在所有错误类别上都优于其他模型。大量的工具选项导致工具选择和参数值选择频繁出错,而幻觉或跳过必需参数的情况很少见。即使所有的工具调用都是正确的,模型(尤其是 Gemini-3-flash-preview 和 Claude-Sonnet-4-5)在从工具响应中综合出正确答案方面也表现挣扎,这可以从错误图表的极右侧的下降中得到证实。

多跳推理:跳跃深度对模型性能的影响

准确率随跳跃深度的增加而下降:模型在单跳问题上表现最好,在两跳问题上性能下降,在三跳或更多跳的问题上所有测试模型性能进一步下降。

多跳多源推理:混合跳跃对模型性能的影响

性能因交互类型而异:单次 API 调用(1-hop API)比多次 API 调用(2-hop API)更容易;添加文档检索器(RAG 跳跃或混合 API-RAG 模式)会增加难度。在 1-hop RAG 问题上,GPT-OSS-120B 倾向于从参数化知识中返回答案而不是调用检索器,这可能是因为问题侧重于维基百科实体。Gemini-3-flash-preview 在 2-hop API-RAG 模式上表现出相对强大的性能,这可能受益于其在仪表板 API 工具选择方面的优势。

策略对模型性能的影响

当策略限制访问最相关的信息源时(“Policy updates the answer”),除 Granite-4.0-h-Small-32B 外,所有模型都经历了明显的性能下降。模型要么违反约束,要么无法检索到足够的信息,有时理解了策略但仍然回答错误。这表明,虽然模型可以对工具和来源进行推理,但它们在将外部约束融入该推理方面存在困难——这是可靠的现实世界部署的关键要求。

结论

VAKRA 揭示了表面层面的工具能力与稳健的端到端智能体可靠性之间的关键差距。尽管现代模型越来越能够选择 API 并执行孤立的工具调用,但基准测试表明,仅凭这些能力不足以进行现实世界的部署;当被要求在跨越 API、文档、对话上下文和策略要求的执行约束下进行组合推理时,模型经常崩溃。

尝试 VAKRA —— 你的智能体在哪里崩溃?

在 VAKRA 基准测试上测试你的智能体,看看它在哪里失败——是工具选择、多跳推理,还是策略约束。

👉 尝试一下并告诉我们你的智能体学到了什么

Sources