TIGER-AI-Lab/ClawBench
Open-source benchmark for browser AI agents on daily tasks.
ClawBench – 실제 웹 작업에서 AI 에이전트 평가하기
무엇인가요 – ClawBench는 AI 기반 브라우저 에이전트가 실제 웹사이트에서 일상적인 온라인 활동(여행 예약, 음식 주문, 취업 지원, 이메일 관리 등)을 얼마나 잘 수행할 수 있는지 측정하는 오픈소스 벤치마크입니다. V1(143개 사이트에서 152개 작업), V2(63개 사이트에서 129개 작업)의 두 가지 작업 코퍼스를 제공하여 총 163개의 실제 웹사이트에서 281개의 작업을 커버합니다.
왜 중요한가요 – 대부분의 LLM 에이전트 연구는 합성 또는 정적 환경에서 평가됩니다. ClawBench는 에이전트를 실제 환경으로 데려가, 실제 웹 페이지를 탐색하고, CAPTCHA를 처리하며, 폼을 채우고, 동적 콘텐츠와 상호작용해야 하는 능력을 요구합니다. 현재 최고의 에이전트도 전체 작업의 약 1/3만 성공시키고 있어, 연구용 프로토타입과 실제 활용 가능성 사이의 큰 격차를 드러냅니다.
주요 구성 요소
- 작업 사양 – 각 작업의 목표, 단계별 평가 기준, 기대 결과를 설명하는 JSON 파일.
- 5단계 기록 파이프라인 – 원시 브라우저 트레이스, 비디오, 오디오, DOM 스냅샷, 고수준 평가 기준 기반 평가를 기록.
- 에이전트 평가자 – LLM 평가자(기본값:
deepseek-v4-pro)가 에이전트의 트레이스를 인간 기준 트레이스와 비교하고 성공 점수를 생성. - 리더보드 – Hugging Face Spaces에서 호스팅되며, V1 및 V2에 대한 모델별 점수를 표시.
- 데이터 – 모든 작업 정의, 평가 기준, 참조 트레이스는 Hugging Face 데이터셋(
NAIL-Group/ClawBench및TIGER-Lab/ClawBenchV2Trace)으로 제공됩니다.
사용 방법
- 설치 –
pip install clawbench-eval(또는uv/pipx를 통해). - 설정 –
models/models.yaml을 편집하여 에이전트 구현 경로를 지정하고, 평가 모델(deepseek-v4-pro)의 API 키를 추가. - 실행 –
clawbench명령어로 모델과 작업을 선택하는 인터랙티브 TUI를 시작하거나,clawbench-run/clawbench-batch로 스크립트 실행 가능. - 컨테이너 기반 허니스 – 첫 실행 시 Chromium, ffmpeg, noVNC, 에이전트 전용 종속성 포함의 Docker/Podman 이미지가 빌드됩니다. 이후 실행은 캐시된 이미지를 재사용하여 빠른 실행이 가능.
- 분석 – 실행 후
clawbench-analyze는 성공/실패, 평가 기준 점수, 브라우저 세션의 비디오 재생을 포함한 보고서를 생성합니다.
벤치마크 확장하기 – 기여를 환영합니다. 새로운 작업을 추가하려면 JSON 사양과 평가 기준을 만들고 PR을 제출하세요. 새로운 모델을 추가하려면 clawbench CLI 인터페이스에 부합하는 드라이버 스크립트를 제공하세요.
자료
- 실시간 리더보드: https://huggingface.co/spaces/TIGER-Lab/ClawBench
- 논문: ClawBench: Can AI Agents Complete Everyday Online Tasks? (arXiv 2604.08523, EMNLP 2026 Findings)
- 작업 탐색기: https://claw-bench.com/tasks
- 데이터셋 다운로드:
hf download NAIL-Group/ClawBench - GitHub: https://github.com/TIGER-AI-Lab/ClawBench
결론 – ClawBench는 브라우저 기반 AI 에이전트의 실제 세계 활용 가능성을 평가할 수 있는 구체적이고 재현 가능한 방법을 제공하며, 풍부한 실시간 웹 작업 세트와 표준화된 점수 매기기 파이프라인을 모두 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트