TIGER-AI-Lab/ClawBench
Open-source benchmark for browser AI agents on daily tasks.
ClawBench – 在真實網路任務中評估 AI 代理
是什麼 – ClawBench 是一個開源基準測試,用於衡量 AI 驅動的瀏覽器代理在實際網站上完成日常線上活動(如預訂旅行、點餐、申請工作、管理郵件等)的能力。它提供兩套任務語料庫(V1 = 143 個網站上的 152 個任務,V2 = 63 個網站上的 129 個任務),總計涵蓋 163 個真實網站上的 281 個任務。
為何重要 – 大多數 LLM 代理的研究都在合成或靜態環境中進行評估。ClawBench 將代理推向真實世界,要求它們導航真實網頁、處理 CAPTCHA、填寫表單並與動態內容互動。目前最優秀的代理僅能成功完成約三分之一的任務,凸顯了研究原型與實際可用性之間的巨大差距。
核心組件
- 任務規範 – 描述每個任務目標、逐步評分標準和預期結果的 JSON 檔案。
- 五層記錄管道 – 捕獲原始瀏覽器軌跡、影片、音訊、DOM 快照以及基於高階評分標準的評估。
- 智能評估器 – 一個 LLM 評判者(預設:
deepseek-v4-pro)將代理的軌跡與人類參考軌跡進行比較,並生成成功評分。 - 排行榜 – 在 Hugging Face Spaces 上托管,展示 V1 和 V2 的各模型得分。
- 資料 – 所有任務定義、評分標準和參考軌跡均可作為 Hugging Face 資料集取得(
NAIL-Group/ClawBench和TIGER-Lab/ClawBenchV2Trace)。
如何使用
- 安裝 –
pip install clawbench-eval(或透過uv/pipx)。 - 設定 – 編輯
models/models.yaml指向你的代理實作,並新增評判模型(deepseek-v4-pro)的 API 金鑰。 - 執行 –
clawbench命令啟動互動式 TUI 以選擇模型和任務,或使用clawbench-run/clawbench-batch進行腳本化執行。 - 容器化沙箱 – 首次執行時會建構一個包含 Chromium、ffmpeg、noVNC 和任何代理特定相依性的 Docker/Podman 鏡像。後續執行將重用快取鏡像以實現快速執行。
- 分析 – 執行結束後,
clawbench-analyze會產生包含成功/失敗、評分標準得分以及瀏覽器會話影片播放的報告。
擴展基準測試 – 歡迎貢獻。要新增任務,請建立 JSON 規範和評分標準,然後提交 PR。要新增模型,請提供符合 clawbench CLI 接口的驅動腳本。
資源
- 即時排行榜:https://huggingface.co/spaces/TIGER-Lab/ClawBench
- 論文:ClawBench: Can AI Agents Complete Everyday Online Tasks?(arXiv 2604.08523,EMNLP 2026 Findings)
- 任務探索器:https://claw-bench.com/tasks
- 資料集下載:
hf download NAIL-Group/ClawBench - GitHub:https://github.com/TIGER-AI-Lab/ClawBench
總結 – ClawBench 為評估基於瀏覽器的 AI 代理在現實世界中的實用性提供了一種具體且可重現的方法,既包含豐富的即時網路任務,也提供標準化的評分流程。
相關
- 專案
- 專案
- 專案
- 專案
- 專案