ServiceNow/AgentLab

AgentLab: An open-source framework for developing, testing, and benchmarking web agents on diverse tasks, designed for scalability and reproducibility.

解决的问题

AgentLab 提供了一个标准化的框架,用于开发和评估基于网页的 AI 代理。它简化了在多个基准测试上运行大规模实验的过程,管理浏览器交互的复杂性,并分析代理在动态网页环境中的性能表现。

工作原理

AgentLab 与 BrowserGym 集成,提供了一套用于代理创建的构建模块。它使用统一的 LLM API 连接到各种提供商(OpenRouter、OpenAI、Azure 或自托管的 TGI),并利用 Ray 实现代理任务的大规模并行执行。该框架包含一个 Study 系统来管理实验,一个 SequentialStudies 对象来处理特定基准测试中的任务依赖关系,以及一个名为 AgentXray 的专用可视化工具,用于检查代理的执行轨迹。

适用人群

专为需要运行广泛基准测试、进行消融研究并确保结果可复现的网页代理研究者和开发者设计。

主要亮点

  • 广泛的基准支持:兼容多种基准测试,包括 WebArena、WorkArena、VisualWebArena、AssistantBench 和 OSWorld。
  • 大规模并行处理:使用 Ray 在单台机器上并行运行数十个任务,并内置超时处理机制,防止任务挂起。
  • 统一的 LLM 接口:通过单一 API 轻松切换不同 LLM 后端。
  • AgentXray 可视化:基于 Gradio 的界面,用于可视化代理轨迹、操作和截图,便于调试和分析性能。
  • 可复现性工具:包含可复现性日志和专用的 ReproducibilityAgent,用于比较不同运行之间的执行差异。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目