InternLM/WildClawBench

An in-the-wild benchmark for AI agents in the production harness.

What it solves

WildClawBench 旨在超越孤立的能力测试(如简单的函数调用或 JSON 解析),以评估 AI agent 是否能够执行复杂的、端到端的真实世界工作。它通过在需要自主规划、错误恢复和多模态合成的长周期任务中,在实时环境中测试 agent,从而填补了基准测试分数与实际效用之间的差距。

How it works

Agent 被部署到实时 OpenClaw 环境中——这是一个个人 AI 助手框架——并配备了真实的工具,例如 Web 浏览器、bash terminal、文件系统、电子邮件和日历。该基准测试包含 60 个原创的、手工构建的任务,涵盖六个类别(Productivity、Code Intelligence、Social Interaction、Search & Retrieval、Creative Synthesis 和 Safety Alignment)。

Who it’s for

该工具适用于正在构建 agentic systems 的 AI 研究人员和开发人员,他们需要一种严谨、实用的方式来衡量模型在复杂、多步工作流中的性能。

Highlights

  • Real-world environments: 使用实时工具而非 mock 来模拟实际的用户工作流。
  • Long-horizon tasks: 测试执行时间跨度为 10-20 分钟、包含 10-60+ 次工具调用的工作流。
  • Multi-modal evaluation: 包括需要视频理解、图像生成和跨模态合成的任务。
  • Harness comparison: 支持多种 agent scaffolds,以将模型性能与框架效率区分开来。
  • Isolated execution: 为每个任务使用 Docker 容器,以确保结果的一致性和可重复性。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目