TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

ClawBench – 実世界のウェブタスクにおけるAIエージェントのベンチマーク

何であるか – ClawBenchは、AI駆動のブラウザエージェントが実際のウェブサイト上で日常的なオンライン活動(旅行の予約、食事の注文、求人の応募、メールの管理など)をどれだけ正確に完了できるかを測定するオープンソースのベンチマークです。V1(143サイトで152タスク)とV2(63サイトで129タスク)の2つのタスクコーパスを提供し、合計163の実世界サイトで281のタスクをカバーしています。

なぜ重要か – ほとんどのLLMエージェントの研究は、合成的または静的な環境で評価されています。ClawBenchはエージェントを現実の世界に投入し、実際のウェブページをナビゲートし、CAPTCHAに対処し、フォームを入力し、動的コンテンツと対話する能力を要求します。現在の最良のエージェントでも、タスクの約1/3しか成功させることができず、研究用プロトタイプと実用性の間にある大きなギャップが浮き彫りになっています。

主な構成要素

  • タスク仕様 – 各タスクの目的、ステップバイステップの評価基準、期待される結果を記述したJSONファイル。
  • 5層記録パイプライン – ブラウザの原始トレース、動画、音声、DOMスナップショット、および高レベルの評価基準に基づく評価を収集。
  • エージェント評価者 – LLMジャッジ(デフォルト:deepseek-v4-pro)がエージェントのトレースを人間の参照トレースと比較し、成功スコアを生成。
  • リーダーボード – Hugging Face Spacesでホストされ、V1およびV2の各モデルごとのスコアを表示。
  • データ – すべてのタスク定義、評価基準、および参照トレースは、Hugging Faceデータセット(NAIL-Group/ClawBench および TIGER-Lab/ClawBenchV2Trace)として利用可能。

使い方

  1. インストールpip install clawbench-evaluv/pipxでも可)。
  2. 設定models/models.yaml を編集して、エージェント実装へのパスを指定し、ジャッジモデル(deepseek-v4-pro)のAPIキーを追加。
  3. 実行clawbench コマンドでモデルとタスクを選択するインタラクティブTUIを起動、または clawbench-run / clawbench-batch でスクリプト実行。
  4. コンテナ化ハーネス – 最初の実行時にChromium、ffmpeg、noVNC、およびエージェント固有の依存関係を含むDocker/Podmanイメージがビルドされます。以降の実行ではキャッシュされたイメージが再利用され、高速な実行が可能。
  5. 分析 – 実行後、clawbench-analyze が成功/失敗、評価基準スコア、ブラウザセッションの動画再生を含むレポートを生成。

ベンチマークの拡張 – コントリビューションを歓迎します。新しいタスクを追加するには、JSON仕様と評価基準を作成し、PRを送信してください。新しいモデルを追加するには、clawbench CLIインターフェースに準拠するドライバスクリプトを提供してください。

リソース


結論 – ClawBenchは、ブラウザベースのAIエージェントの実世界での有用性を評価するための明確で再現可能な方法を提供し、ライブウェブタスクの豊富なセットと標準化されたスコアリングパイプラインを両方提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト