TIGER-AI-Lab/ClawBench
Open-source benchmark for browser AI agents on daily tasks.
ClawBench – 在真实网络任务中对 AI 代理进行基准测试
是什么 – ClawBench 是一个开源基准测试,用于衡量 AI 驱动的浏览器代理在真实网站上完成日常在线活动(如预订旅行、点餐、申请工作、管理邮件等)的能力。它提供两套任务语料库(V1 = 143 个网站上的 152 项任务,V2 = 63 个网站上的 129 项任务),总计覆盖 163 个真实网站上的 281 项任务。
为何重要 – 大多数 LLM 代理的研究都在合成或静态环境中进行评估。ClawBench 将代理推向真实世界,要求它们导航真实网页、处理 CAPTCHA、填写表单并交互动态内容。目前最先进的代理仅能成功完成约三分之一的任务,凸显了研究原型与实际可用性之间的巨大差距。
核心组件
- 任务规范 – 描述每个任务目标、分步评分标准和预期结果的 JSON 文件。
- 五层记录管道 – 捕获原始浏览器轨迹、视频、音频、DOM 快照以及基于高阶评分标准的评估。
- 智能评估器 – 一个 LLM 评判者(默认:
deepseek-v4-pro)将代理的轨迹与人类参考轨迹进行比较,并生成成功评分。 - 排行榜 – 在 Hugging Face Spaces 上托管,展示 V1 和 V2 的各模型得分。
- 数据 – 所有任务定义、评分标准和参考轨迹均可作为 Hugging Face 数据集获取(
NAIL-Group/ClawBench和TIGER-Lab/ClawBenchV2Trace)。
如何使用
- 安装 –
pip install clawbench-eval(或通过uv/pipx)。 - 配置 – 编辑
models/models.yaml指向你的代理实现,并添加评判模型(deepseek-v4-pro)的 API 密钥。 - 运行 –
clawbench命令启动交互式 TUI 以选择模型和任务,或使用clawbench-run/clawbench-batch进行脚本化运行。 - 容器化沙箱 – 首次运行时会构建一个包含 Chromium、ffmpeg、noVNC 和任何代理特定依赖项的 Docker/Podman 镜像。后续运行将复用缓存镜像以实现快速执行。
- 分析 – 运行结束后,
clawbench-analyze生成包含成功/失败、评分标准得分以及浏览器会话视频回放的报告。
扩展基准测试 – 欢迎贡献。要添加新任务,请创建 JSON 规范和评分标准,然后提交 PR。要添加新模型,请提供符合 clawbench CLI 接口的驱动脚本。
资源
- 实时排行榜:https://huggingface.co/spaces/TIGER-Lab/ClawBench
- 论文:ClawBench: Can AI Agents Complete Everyday Online Tasks?(arXiv 2604.08523,EMNLP 2026 Findings)
- 任务探索器:https://claw-bench.com/tasks
- 数据集下载:
hf download NAIL-Group/ClawBench - GitHub:https://github.com/TIGER-AI-Lab/ClawBench
总结 – ClawBench 为评估基于浏览器的 AI 代理在现实世界中的实用性提供了一种具体且可复现的方法,既包含丰富的实时网络任务,也提供标准化的评分流程。
相关
- 项目
- 项目
- 项目
- 项目
- 项目