TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

What it solves

ClawBench는 실제 세계의 일상 온라인 작업을 AI 브라우저 에이전트가 얼마나 잘 수행할 수 있는지를 평가하기 위해 설계된 오픈소스 벤치마크입니다. 여행 예약, 음식 주문, 구직 신청, 실시간 웹사이트에서의 이메일 관리와 같은 복잡한 활동을 수행하는 에이전트의 엔드‑투‑엔드 성공률을 측정하는 격차를 메웁니다.

How it works

ClawBench는 Chromium과 특정 에이전트 하네스를 포함한 격리된 Docker 또는 Podman 컨테이너를 실행함으로써 동작합니다. AI 에이전트가 브라우저를 구동해 실시간 웹사이트를 탐색하고 상호작용합니다. 정확한 채점을 위해 시스템은 요청 인터셉터를 사용해 다섯 계층(비디오 녹화, 요청 로그, 액션 로그, 에이전트 메시지, 인터셉션 데이터)의 데이터를 캡처하고, 이를 에이전트 평가자가 인간 레퍼런스와 비교합니다.

Who it’s for

이 도구는 브라우저 자동화와 "컴퓨터 사용" 기능에 중점을 둔 AI 에이전트를 개발하는 개발자와 연구자를 위해 설계되었습니다. 다양한 실제 작업에서 에이전트의 성공률을 표준화된 방식으로 측정하고자 하는 사람들에게 적합합니다.

Highlights

  • Extensive Task Library: Includes V1 (153 tasks) and V2 (130 tasks) covering 144 live websites across 15 life categories.
  • Isolated Execution: Uses Docker/Podman containers to ensure a clean, isolated environment for browser interactions.
  • Five-Layer Recording: Captures comprehensive execution traces (MP4 video, JSONL requests, action logs, etc.) for detailed analysis.
  • Two-Stage Scoring: Employs a request interceptor and an inline LLM judge to automatically produce pass/fail results.