TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

ClawBench – 在真实网络任务中对 AI 代理进行基准测试

是什么 – ClawBench 是一个开源基准测试,用于衡量 AI 驱动的浏览器代理在真实网站上完成日常在线活动(如预订旅行、点餐、申请工作、管理邮件等)的能力。它提供两套任务语料库(V1 = 143 个网站上的 152 项任务,V2 = 63 个网站上的 129 项任务),总计覆盖 163 个真实网站上的 281 项任务。

为何重要 – 大多数 LLM 代理的研究都在合成或静态环境中进行评估。ClawBench 将代理推向真实世界,要求它们导航真实网页、处理 CAPTCHA、填写表单并交互动态内容。目前最先进的代理仅能成功完成约三分之一的任务,凸显了研究原型与实际可用性之间的巨大差距。

核心组件

  • 任务规范 – 描述每个任务目标、分步评分标准和预期结果的 JSON 文件。
  • 五层记录管道 – 捕获原始浏览器轨迹、视频、音频、DOM 快照以及基于高阶评分标准的评估。
  • 智能评估器 – 一个 LLM 评判者(默认:deepseek-v4-pro)将代理的轨迹与人类参考轨迹进行比较,并生成成功评分。
  • 排行榜 – 在 Hugging Face Spaces 上托管,展示 V1 和 V2 的各模型得分。
  • 数据 – 所有任务定义、评分标准和参考轨迹均可作为 Hugging Face 数据集获取(NAIL-Group/ClawBenchTIGER-Lab/ClawBenchV2Trace)。

如何使用

  1. 安装pip install clawbench-eval(或通过 uv/pipx)。
  2. 配置 – 编辑 models/models.yaml 指向你的代理实现,并添加评判模型(deepseek-v4-pro)的 API 密钥。
  3. 运行clawbench 命令启动交互式 TUI 以选择模型和任务,或使用 clawbench-run / clawbench-batch 进行脚本化运行。
  4. 容器化沙箱 – 首次运行时会构建一个包含 Chromium、ffmpeg、noVNC 和任何代理特定依赖项的 Docker/Podman 镜像。后续运行将复用缓存镜像以实现快速执行。
  5. 分析 – 运行结束后,clawbench-analyze 生成包含成功/失败、评分标准得分以及浏览器会话视频回放的报告。

扩展基准测试 – 欢迎贡献。要添加新任务,请创建 JSON 规范和评分标准,然后提交 PR。要添加新模型,请提供符合 clawbench CLI 接口的驱动脚本。

资源


总结 – ClawBench 为评估基于浏览器的 AI 代理在现实世界中的实用性提供了一种具体且可复现的方法,既包含丰富的实时网络任务,也提供标准化的评分流程。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目