InternLM/WildClawBench
An in-the-wild benchmark for AI agents in the production harness.
What it solves
WildClawBench 旨在超越孤立的能力测试(如简单的函数调用或 JSON 解析),以评估 AI agent 是否能够执行复杂的、端到端的真实世界工作。它通过在需要自主规划、错误恢复和多模态合成的长周期任务中,在实时环境中测试 agent,从而填补了基准测试分数与实际效用之间的差距。
How it works
Agent 被部署到实时 OpenClaw 环境中——这是一个个人 AI 助手框架——并配备了真实的工具,例如 Web 浏览器、bash terminal、文件系统、电子邮件和日历。该基准测试包含 60 个原创的、手工构建的任务,涵盖六个类别(Productivity、Code Intelligence、Social Interaction、Search & Retrieval、Creative Synthesis 和 Safety Alignment)。
Who it’s for
该工具适用于正在构建 agentic systems 的 AI 研究人员和开发人员,他们需要一种严谨、实用的方式来衡量模型在复杂、多步工作流中的性能。
Highlights
- Real-world environments: 使用实时工具而非 mock 来模拟实际的用户工作流。
- Long-horizon tasks: 测试执行时间跨度为 10-20 分钟、包含 10-60+ 次工具调用的工作流。
- Multi-modal evaluation: 包括需要视频理解、图像生成和跨模态合成的任务。
- Harness comparison: 支持多种 agent scaffolds,以将模型性能与框架效率区分开来。
- Isolated execution: 为每个任务使用 Docker 容器,以确保结果的一致性和可重复性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目