StonyBrookNLP/appworld

🌍 AppWorld: A Controllable World of Apps and People for Benchmarking Function Calling and Interactive Coding Agent, ACL'24 Best Resource Paper.

解决的问题

AppWorld 为需要通过 API 和代码与软件交互的 AI 代理提供了一个真实且可执行的测试环境。研究人员和开发者可以在无需承担真实服务使用成本或风险的情况下,在受控但逼真的环境中衡量其代理处理复杂多步任务的能力。

工作原理

AppWorld 模拟了一个约 100 人使用 9 个日常应用(如 Spotify 或 Venmo)的世界,通过 457 个 HTTP API 进行交互。每个任务定义了监督者、指令和初始状态(数据库和时间)。代理必须自主编写并执行调用这些 API 的代码,使用 ApiDocs 和 Supervisor 等辅助应用来完成指令。引擎会追踪操作,根据真实设定评估正确性,并记录输出以供排行榜提交。该环境是沙箱化的,可使用 FastAPI 的测试客户端进行无服务器运行,或通过 Docker 实现隔离执行。

适用对象

构建和比较 LLM 驱动代理的研究人员,特别是专注于函数调用、工具使用和交互式编码的。也适用于测试代理框架的开发者,或研究模型在处理现实、多步数字任务方面表现的任何人。

特色亮点

  • 高保真模拟:9 个真实应用、457 个 API 和约 100 个具有关系的模拟人物。
  • 自然且多样化的任务,需要丰富的交互式编码和 API 调用。
  • 全面的工具链:提供 CLI 用于安装、数据下载、探索、评估和排行榜提交。
  • 包含加密和 Canary 字符串,以降低泄露到训练语料库的风险。
  • 支持多种代理框架,并包含 MCP 服务器/客户端集成。
  • 活跃的排行榜和详尽的文档、指南和视频。

相关

  • 项目
  • 项目
  • 项目
  • 项目