InternLM/WildClawBench
An in-the-wild benchmark for AI agents in the OpenClaw Environment.
解决的问题
大多数 AI Agent 基准测试都集中在孤立的能力上,例如解析 JSON 或调用单个函数。WildClawBench 通过将 Agent 置于实时环境中,使其执行需要自主规划和错误恢复的复杂多步骤任务,从而解决了测试真实世界端到端代理能力的需求。
工作原理
该基准测试包含 6 个类别(Productivity, Code, Social, Search, Creative, 和 Safety)的 60 个手工构建的任务,在实时 OpenClaw 环境中执行。它利用 Docker 容器确保每个任务都在一个隔离、可复现的环境中运行,并配备浏览器、bash 和文件系统等真实工具。它支持四种不同的 Agent 框架(OpenClaw, Claude Code, Codex CLI, 和 Hermes Agent),以将模型能力与周围的脚手架(scaffolding)分离。
适用对象
专为构建自主 Agent 的 AI 研究人员和开发人员设计,他们需要衡量模型在实际的、长程工作流中的表现,而不仅仅是简单的指令遵循测试。
亮点
- 真实世界环境: 使用实时工具(浏览器、电子邮件、日历)而非模拟工具。
- 多样化的任务套件: 包括视频高光剪辑等多模态任务,以及调试未记录文档的代码库等复杂编码任务。
- 多框架评估: 允许在不同的 Agent 脚手架下比较同一个模型。
- 鲁棒性测试: 包括检测泄露的 API 密钥和抵御提示词注入等安全性对齐任务。
- 可复现的结果: 使用隔离的 Docker 容器,并通过仅在执行后注入评分脚本来防止数据泄露。