InternLM/WildClawBench
An in-the-wild benchmark for AI agents in the OpenClaw Environment.
解決的問題
大多數 AI Agent 基準測試都集中在孤立的能力上,例如解析 JSON 或呼叫單個函數。WildClawBench 透過將 Agent 置於實時環境中,使其執行需要自主規劃和錯誤恢復的複雜多步驟任務,從而解決了測試真實世界端到端代理能力的需求。
工作原理
該基準測試包含 6 個類別(Productivity, Code, Social, Search, Creative, 和 Safety)的 60 個手工構建的任務,在實時 OpenClaw 環境中執行。它利用 Docker 容器確保每個任務都在一個隔離、可復現的環境中運行,並配備瀏覽器、bash 和檔案系統等真實工具。它支援四種不同的 Agent 框架(OpenClaw, Claude Code, Codex CLI, 和 Hermes Agent),以將模型能力與周圍的腳手架(scaffolding)分離。
適用對象
專為構建自主 Agent 的 AI 研究人員和開發人員設計,他們需要衡量模型在實際的、長程工作流中的表現,而不僅僅是簡單的指令遵循測試。
亮點
- 真實世界環境: 使用實時工具(瀏覽器、電子郵件、日曆)而非模擬工具。
- 多樣化的任務套件: 包括影片高光剪輯等多模態任務,以及除錯未記錄文件代碼庫等複雜編碼任務。
- 多框架評估: 允許在不同的 Agent 腳手架下比較同一個模型。
- 魯棒性測試: 包括檢測洩露的 API 金鑰和抵禦提示詞注入等安全性對齊任務。
- 可復現的結果: 使用隔離的 Docker 容器,並透過僅在執行後注入評分腳本來防止數據洩漏。