TIGER-AI-Lab/ClawBench
Open-source benchmark for browser AI agents on daily tasks.
What it solves
ClawBench 是一个开源基准,旨在评估 AI 浏览器代理完成真实世界、日常在线任务的能力。它填补了衡量代理在执行复杂活动(如预订旅行、点餐、申请工作以及在实时网站上管理电子邮件)时端到端成功率的空白。
How it works
ClawBench 通过启动一个包含 Chromium 与特定代理 harness 的隔离 Docker 或 Podman 容器来运行。AI 代理随后驱动浏览器在实时网站上导航与交互。为确保评分准确,系统使用请求拦截器捕获五层数据(包括视频录制、请求日志、操作日志、代理消息与拦截数据),再由代理式评估器与人工参考进行比较。
Who it’s for
此工具面向构建 AI 代理的开发者和研究人员,特别是专注于浏览器自动化和“计算机使用”能力的团队,他们需要一种标准化方式来衡量其代理在多样、真实任务上的成功率。
Highlights
- Extensive Task Library: Includes V1 (153 tasks) and V2 (130 tasks) covering 144 live websites across 15 life categories.
- Isolated Execution: Uses Docker/Podman containers to ensure a clean, isolated environment for browser interactions.
- Five-Layer Recording: Captures comprehensive execution traces (MP4 video, JSONL requests, action logs, etc.) for detailed analysis.
- Two-Stage Scoring: Employs a request interceptor and an inline LLM judge to automatically produce pass/fail results.