ServiceNow/AgentLab
AgentLab: An open-source framework for developing, testing, and benchmarking web agents on diverse tasks, designed for scalability and reproducibility.
解决的问题
AgentLab 提供了一个标准化的框架,用于开发和评估基于网页的 AI 代理。它简化了在多个基准测试上运行大规模实验的过程,管理浏览器交互的复杂性,并分析代理在动态网页环境中的性能表现。
工作原理
AgentLab 与 BrowserGym 集成,提供了一套用于代理创建的构建模块。它使用统一的 LLM API 连接到各种提供商(OpenRouter、OpenAI、Azure 或自托管的 TGI),并利用 Ray 实现代理任务的大规模并行执行。该框架包含一个 Study 系统来管理实验,一个 SequentialStudies 对象来处理特定基准测试中的任务依赖关系,以及一个名为 AgentXray 的专用可视化工具,用于检查代理的执行轨迹。
适用人群
专为需要运行广泛基准测试、进行消融研究并确保结果可复现的网页代理研究者和开发者设计。
主要亮点
- 广泛的基准支持:兼容多种基准测试,包括 WebArena、WorkArena、VisualWebArena、AssistantBench 和 OSWorld。
- 大规模并行处理:使用 Ray 在单台机器上并行运行数十个任务,并内置超时处理机制,防止任务挂起。
- 统一的 LLM 接口:通过单一 API 轻松切换不同 LLM 后端。
- AgentXray 可视化:基于 Gradio 的界面,用于可视化代理轨迹、操作和截图,便于调试和分析性能。
- 可复现性工具:包含可复现性日志和专用的 ReproducibilityAgent,用于比较不同运行之间的执行差异。
相关
- 项目
- 项目
- 项目
- 项目
- 项目