OpenEnv: 在真实环境中评估使用工具的智能体
Hugging Face 和 Meta 推出了 OpenEnv,这是一个开源框架,旨在标准化评估与真实世界系统交互的 AI 智能体。通过将评估从受控模拟转向真实工具和 API,OpenEnv 旨在弥合研究成功与生产可靠性之间持久存在的差距。
OpenEnv 框架概述
OpenEnv 提供了一种标准化的方法,将 AI 智能体连接到真实的流程和工具,同时保持一致的评估结构。它利用了面向 gym 的 API——具有 reset、step、action 和 observations 特性——类似于 OpenAI 的 Gymnasium。
为了确保不同领域和环境之间的一致性,OpenEnv 采用了标准的 Model Context Protocol (MCP) 工具调用接口。该框架的关键特性包括:
- 真实系统交互:针对实际系统而非模拟环境评估智能体。
- 状态维护:环境在多个动作之间维护状态,这允许对长程推理进行评估。
- 直接 API 连接:智能体可以直接连接到真实世界的工具,如代码仓库、浏览器和日历。
Calendar Gym 基准测试
为了展示 OpenEnv 的效用,Turing 贡献了 Calendar Gym,这是一个专门用于日历管理的生产级环境。日历系统被用作基准测试,因为它们要求智能体处理复杂的真实世界约束,包括:
- 访问控制列表 (ACLs):管理不同用户和日历之间的权限。
- 部分可观测性:处理对其他用户状态的有限可见性。
- 多步工作流:按正确顺序链接多个依赖操作。
- 时间推理:对时间进行推理并处理日期/时间格式。
在 Calendar Gym 中,智能体与各种操作进行交互,例如列出日历和插入事件,同时在隔离的环境中运行,以确保不同运行之间的可靠比较。
智能体可靠性的关键发现
在 Calendar Gym 中的智能体评估显示,随着任务变得更加模糊且持续时间变长,可靠性会下降。识别出的主要瓶颈包括:
多步推理
智能体难以在较长的流程中正确链接动作,这表明基准测试必须超越测试单个工具调用,转向测试在多个依赖步骤上的持续推理能力。
歧义消除
自然语言描述会显著阻碍性能。在具有明确日历标识符的任务中,智能体实现了近乎 90% 的成功率,但当任务以自然语言表述时,这一比例下降到约 40%。
执行质量
仅选择正确的工具对于可靠性来说是不够的。在失败的交互中,超过一半的错误是由格式错误的工具参数或错误的顺序引起的,即使在选择了正确的工具的情况下也是如此。
常见工具使用失败模式
对生产级工具集成的分析揭示了智能体在与真实 API 交互时遇到的三种循环出现的失败模式:
1. Schema 验证错误
这些错误发生在智能体调用了有效的工具但提供的参数不符合 JSON schema,例如缺少必填字段(例如,calendarId)或数据类型不正确(例如,在需要对象的地方传递了字符串)。
2. 权限与授权错误
这些是语法正确的调用,但由于权限不足而被 API 拒绝,例如访问令牌过期或缺少 OAuth scopes。研究人员建议提供结构化的、可操作的修复步骤,以帮助智能体引导用户,而不是重复尝试相同的失败调用。
3. 日期时间与格式错误
失败通常由于非 RFC3339 日期时间格式或缺失时区偏移量而引起。建议的缓解措施是统一使用带有明确时区偏移量的 RFC3339,并在文档中提供正确的示例以锚定模型行为。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch