Hugging Face Gaia2 与 Meta Agents Research Environments(ARE)发布

Hugging Face 推出了 Gaia2 和 Meta Agents Research Environments(ARE)框架,以便在复杂的真实世界模拟环境中研究 AI 代理。此前的基准主要关注只读检索,而 Gaia2 引入了交互式的读写任务,测试代理处理歧义、噪声和时间推理的能力。

Gaia2:读写型代理基准

Gaia2 是 2023 年 GAIA 基准的继任者。它将关注点从简单的信息检索转向交互行为和复杂性管理。与前作不同,Gaia2 评估代理在处理模糊或时间敏感查询时遵循指令的能力,以及在包含受控故障的噪声环境中运行的能力。

关键任务组

Gaia2 使用了 1,000 条人工创建的情景,分为七大核心能力:

  • Execution:多步骤指令执行和工具使用(例如,更新联系人)。
  • Search:跨多个来源收集信息(例如,从 WhatsApp 提取数据)。
  • Ambiguity Handling:解决冲突请求(例如,日程冲突)。
  • Adaptability:对模拟中的变化作出响应(例如,根据新信息更新电子邮件)。
  • Time/Temporal Reasoning:执行时间敏感的操作(例如,延迟后叫车)。
  • Agent-to-Agent Collaboration:在没有直接 API 访问的情况下实现代理之间的通信。
  • Noise Tolerance:即使在 API 失效和环境不稳定的情况下仍保持鲁棒性。

评估环境与基础设施

Gaia2 运行在 Meta Agents Research Environments(ARE)中,该环境提供了模拟日常人类活动的智能手机模型。此环境包含模拟的应用程序,如 Email、Calendar、Contacts、Shopping 和 FileSystem,均可通过工具调用访问。

为便于调试和分析,ARE 将所有代理交互记录为结构化追踪。这些追踪包括工具调用、API 响应、模型思考以及时间指标(如响应延迟),可导出为 JSON。

性能结果与模型分析

截至 2025 年 9 月,GPT-5(具备高推理能力)是整体得分最高的模型,而 Kimi K2 是表现最佳的开源模型。

能力差距

评估结果显示模型在不同任务类型上的表现存在显著差距:

  • Solved Capabilities:简单的工具调用、指令执行(execution)以及通用 search 被顶级模型视为基本已解决。
  • Challenging Capabilities:歧义、适应性和噪声容忍仍然对所有测试模型构成挑战。
  • Critical Weakness:时间推理(time)目前是最难的分支,模型在正确处理时间敏感操作方面表现不足。

成本‑性能分析

除了原始准确率外,Hugging Face 还强调效率的重要性。评估将分数相对于成本进行归一化,成本通过平均 LLM 调用次数和输出 token 数量衡量,以建立成本‑性能的帕累托前沿。

Meta Agents Research Environments(ARE)框架

ARE 被设计为一个开放框架(MIT 许可证),旨在超越静态基准,使研究者能够通过交互研究代理。

定制化与使用场景

研究者可以通过 Model Context Protocol(MCP)或直接方式连接自己的工具来扩展 ARE,并通过实现带触发器或定时事件的自定义情景,测试代理如何适应不断演变的环境。

关键使用场景包括:

  • Vibe-checking agents:在真实或模拟数据上进行情绪检查的代理。
  • Testing tool orchestration:使用本地应用或 MCP 工具进行工具编排测试。
  • Generating tool-calling traces:生成工具调用追踪以用于模型微调。
  • Reproducing existing agentic benchmarks:在统一框架内复现现有的代理基准。
  • Debugging agent-to-agent interactions:通过用户界面调试代理间交互。
  • Studying model limitations:在带有 API 超时的噪声环境中研究模型局限性。

实现与许可

  • Gaia2 Dataset:在 CC BY 4.0 许可证下发布。
  • ARE Framework:在 MIT 许可证下发布。
  • Installation:可以通过 pip install meta-agents-research-environments 安装环境。

Sources