TIGER-AI-Lab/ClawBench

Open-source benchmark for browser AI agents on daily tasks.

ClawBench – 在真實網路任務中評估 AI 代理

是什麼 – ClawBench 是一個開源基準測試,用於衡量 AI 驅動的瀏覽器代理在實際網站上完成日常線上活動(如預訂旅行、點餐、申請工作、管理郵件等)的能力。它提供兩套任務語料庫(V1 = 143 個網站上的 152 個任務,V2 = 63 個網站上的 129 個任務),總計涵蓋 163 個真實網站上的 281 個任務。

為何重要 – 大多數 LLM 代理的研究都在合成或靜態環境中進行評估。ClawBench 將代理推向真實世界,要求它們導航真實網頁、處理 CAPTCHA、填寫表單並與動態內容互動。目前最優秀的代理僅能成功完成約三分之一的任務,凸顯了研究原型與實際可用性之間的巨大差距。

核心組件

  • 任務規範 – 描述每個任務目標、逐步評分標準和預期結果的 JSON 檔案。
  • 五層記錄管道 – 捕獲原始瀏覽器軌跡、影片、音訊、DOM 快照以及基於高階評分標準的評估。
  • 智能評估器 – 一個 LLM 評判者(預設:deepseek-v4-pro)將代理的軌跡與人類參考軌跡進行比較,並生成成功評分。
  • 排行榜 – 在 Hugging Face Spaces 上托管,展示 V1 和 V2 的各模型得分。
  • 資料 – 所有任務定義、評分標準和參考軌跡均可作為 Hugging Face 資料集取得(NAIL-Group/ClawBenchTIGER-Lab/ClawBenchV2Trace)。

如何使用

  1. 安裝pip install clawbench-eval(或透過 uv/pipx)。
  2. 設定 – 編輯 models/models.yaml 指向你的代理實作,並新增評判模型(deepseek-v4-pro)的 API 金鑰。
  3. 執行clawbench 命令啟動互動式 TUI 以選擇模型和任務,或使用 clawbench-run / clawbench-batch 進行腳本化執行。
  4. 容器化沙箱 – 首次執行時會建構一個包含 Chromium、ffmpeg、noVNC 和任何代理特定相依性的 Docker/Podman 鏡像。後續執行將重用快取鏡像以實現快速執行。
  5. 分析 – 執行結束後,clawbench-analyze 會產生包含成功/失敗、評分標準得分以及瀏覽器會話影片播放的報告。

擴展基準測試 – 歡迎貢獻。要新增任務,請建立 JSON 規範和評分標準,然後提交 PR。要新增模型,請提供符合 clawbench CLI 接口的驅動腳本。

資源


總結 – ClawBench 為評估基於瀏覽器的 AI 代理在現實世界中的實用性提供了一種具體且可重現的方法,既包含豐富的即時網路任務,也提供標準化的評分流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案