TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

ClawBench – 실제 웹 작업에서 AI 에이전트 평가하기

무엇인가요 – ClawBench는 AI 기반 브라우저 에이전트가 실제 웹사이트에서 일상적인 온라인 활동(여행 예약, 음식 주문, 취업 지원, 이메일 관리 등)을 얼마나 잘 수행할 수 있는지 측정하는 오픈소스 벤치마크입니다. V1(143개 사이트에서 152개 작업), V2(63개 사이트에서 129개 작업)의 두 가지 작업 코퍼스를 제공하여 총 163개의 실제 웹사이트에서 281개의 작업을 커버합니다.

왜 중요한가요 – 대부분의 LLM 에이전트 연구는 합성 또는 정적 환경에서 평가됩니다. ClawBench는 에이전트를 실제 환경으로 데려가, 실제 웹 페이지를 탐색하고, CAPTCHA를 처리하며, 폼을 채우고, 동적 콘텐츠와 상호작용해야 하는 능력을 요구합니다. 현재 최고의 에이전트도 전체 작업의 약 1/3만 성공시키고 있어, 연구용 프로토타입과 실제 활용 가능성 사이의 큰 격차를 드러냅니다.

주요 구성 요소

  • 작업 사양 – 각 작업의 목표, 단계별 평가 기준, 기대 결과를 설명하는 JSON 파일.
  • 5단계 기록 파이프라인 – 원시 브라우저 트레이스, 비디오, 오디오, DOM 스냅샷, 고수준 평가 기준 기반 평가를 기록.
  • 에이전트 평가자 – LLM 평가자(기본값: deepseek-v4-pro)가 에이전트의 트레이스를 인간 기준 트레이스와 비교하고 성공 점수를 생성.
  • 리더보드 – Hugging Face Spaces에서 호스팅되며, V1 및 V2에 대한 모델별 점수를 표시.
  • 데이터 – 모든 작업 정의, 평가 기준, 참조 트레이스는 Hugging Face 데이터셋(NAIL-Group/ClawBenchTIGER-Lab/ClawBenchV2Trace)으로 제공됩니다.

사용 방법

  1. 설치pip install clawbench-eval (또는 uv/pipx를 통해).
  2. 설정models/models.yaml을 편집하여 에이전트 구현 경로를 지정하고, 평가 모델(deepseek-v4-pro)의 API 키를 추가.
  3. 실행clawbench 명령어로 모델과 작업을 선택하는 인터랙티브 TUI를 시작하거나, clawbench-run / clawbench-batch로 스크립트 실행 가능.
  4. 컨테이너 기반 허니스 – 첫 실행 시 Chromium, ffmpeg, noVNC, 에이전트 전용 종속성 포함의 Docker/Podman 이미지가 빌드됩니다. 이후 실행은 캐시된 이미지를 재사용하여 빠른 실행이 가능.
  5. 분석 – 실행 후 clawbench-analyze는 성공/실패, 평가 기준 점수, 브라우저 세션의 비디오 재생을 포함한 보고서를 생성합니다.

벤치마크 확장하기 – 기여를 환영합니다. 새로운 작업을 추가하려면 JSON 사양과 평가 기준을 만들고 PR을 제출하세요. 새로운 모델을 추가하려면 clawbench CLI 인터페이스에 부합하는 드라이버 스크립트를 제공하세요.

자료


결론 – ClawBench는 브라우저 기반 AI 에이전트의 실제 세계 활용 가능성을 평가할 수 있는 구체적이고 재현 가능한 방법을 제공하며, 풍부한 실시간 웹 작업 세트와 표준화된 점수 매기기 파이프라인을 모두 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트