TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

What it solves

ClawBench は、実世界の毎日のオンラインタスクを AI ブラウザエージェントがどれだけうまく完了できるかを評価するために設計されたオープンソースベンチマークです。旅行の予約、食事の注文、求人への応募、ライブウェブサイト上でのメール管理といった複雑な活動を行うエージェントのエンドツーエンド成功率を測定するギャップを埋めます。

How it works

ClawBench は、Chromium と特定のエージェントハーネスを含む隔離された Docker または Podman コンテナを起動して動作します。AI エージェントがブラウザを操作し、ライブウェブサイトをナビゲートしてインタラクトします。正確なスコアリングを保証するために、システムはリクエストインターセプターを使用して 5 つの層(ビデオ録画、リクエストログ、アクションログ、エージェントメッセージ、インターセプトデータ)からデータを取得し、エージェント評価者が人間のリファレンスと比較します。

Who it’s for

このツールは、AI エージェント、特にブラウザ自動化や「コンピュータ使用」機能に焦点を当てている開発者や研究者向けに設計されており、さまざまな実世界タスクにおけるエージェントの成功率を標準化された方法で測定したい方に最適です。

Highlights

  • Extensive Task Library: Includes V1 (153 tasks) and V2 (130 tasks) covering 144 live websites across 15 life categories.
  • Isolated Execution: Uses Docker/Podman containers to ensure a clean, isolated environment for browser interactions.
  • Five-Layer Recording: Captures comprehensive execution traces (MP4 video, JSONL requests, action logs, etc.) for detailed analysis.
  • Two-Stage Scoring: Employs a request interceptor and an inline LLM judge to automatically produce pass/fail results.