DABStep: 多步骤推理的数据代理基准

Hugging Face 和 Adyen 开发了用于多步骤推理的数据代理基准(DABStep),这是一个由超过 450 个数据分析任务组成的专门评估框架。该基准揭示了当前 AI 代理中的显著性能差距,最强的基于推理的模型在难任务集上的准确率仅为 16%。

DASBenchmark Design

DABStep 的设计目的是评估代理工作流——在此工作流中,LLM 使用工具独立执行多步骤任务——特定地放置在真实世界数据分析的背景下。与合成基准不同,DABStep 使用从实际 Adyen 工作负载中提取的任务来模拟专业数据分析师面临的挑战。

主要特点

  • 真实世界用例:该基准利用基于实际工作负载的超过 450 个任务,避免“玩具问题”,以更好地反映日常分析挑战。
  • 结构化和非结构化数据:任务要求模型在结构化数据集(CSV、JSON)和非结构化领域知识(markdown 手册、手册)之间导航。
  • 事实评估:为了确保客观、无模型的评分,基准基于简单的词语、数字或多选答案使用二元(对/错)结果。
  • 多步骤复杂性:任务的设计使得它们不能通过一次代码执行解决;它们需要迭代问题求解和顺序推理。

数据组成

该基准包含各种金融支付行业数据集,例如:

  • payments.csv:带有欺诈和风险信号的匿名交易。
  • fees.json:一个包含 1,000 个方案费用结构的数据集。
  • manual.md:一份用于解决任务的基本业务知识的提炼手册。
  • 其他元数据:收款方国家和商户类别代码(MCCs)的表格。

任务难度和泛化

DABStep 将任务分为两个难度级别,以提供代理能力的细粒度视图:

  • 简单级别:这些作为热身,只需要一个结构化数据集和最少的上下文。Llama 70B 零射提示在这些任务上的准确率可以超过 90%。
  • 困难级别:这些需要多个结构化数据集和特定领域知识。这些任务需要多步骤归纳推理和迭代代码生成。

为了防止“幸运猜测”并确保核心推理的可重复性,基准通过时间范围和商户名称的排列来爆炸任务基数,采用 符号推理。它还使用 保留测试集 来评估代理在初始版本中未捕获的分析任务上的泛化能力。

性能基线和模型分析

在难任务集上的初步评估表明,即使是最先进的推理模型也在复杂数据分析中挣扎。

准确率结果

  • o3-mini:16% 准确率(表现最佳)。
  • DeepSeek R1:13% 准确率。
  • Claude 3.5 Sonnet:12% 准确率。
  • DeepSeek V3:6% 准确率。

技术观察

研究人员发现,推理模型(如 o1 和 R1)在使用对聊天模型效果良好的标准 ReAct 提示时表现不佳(0% 准确率)。这些模型需要专门的“推理提示”才能有效工作。常见的失败模式包括无效的代码语法、指令遵循不佳以及未能执行顺序步骤。

成本-性能权衡

对商业产品的分析显示这些代理具有不同的经济性:

  • o1 在完整基准上的成本最高,为 435 美元(每任务 0.967 美元)。
  • DeepSeek R1 和 GPT-4o-mini 是最具成本效益的,完整基准成本为 3 美元(每任务 0.007 美元)。
  • 研究人员指出,DeepSeek R1 相对于其低成本提供了高性能的理想经济特征。

DABStep 的未来路线图

Hugging Face 和 Adyen 计划随着 AI 模型的改进而发展基准以保持其有效性。未来的扩展包括:

  • 扩展任务范围:超越欺诈和费用,进入批准率、认证流失和季节性成分。
  • 跨域应用:纳入健康、生物学、保险和电信领域的数据集。
  • 增加数据规模:引入超过内存限制的数据集,需要使用分布式计算引擎。
  • 复杂文档:添加 PDF 格式和版本化逻辑以测试上下文窗口限制。
  • 多模态能力:添加需要解释和创建图表和图形的任务。

Sources