ukanwat/aaabench

A long-horizon benchmark harness: give a coding agent a real game engine, professional conditions and time, and ask it to build an open-world game. Harness only, no results.

解决的问题

AAABench 是一个基准测试,用于检验 AI 编码代理是否能够完全独立地构建一个真实可信的开放世界游戏。大多数 AI 基准测试要求模型解决一个狭窄的任务或回答一个问题。而本基准测试则为代理提供一个真实的游戏引擎、一个高要求的指令,以及数小时的无人监督时间,然后衡量该代理是否能在没有人类帮助的情况下,自主设计城市、构建游戏,并发现并修正自身的错误。

如何工作

该框架运行一个编码代理(默认为 Claude,但任何无头 CLI 均可),与一个实时的 Unreal Engine 5 编辑器交互。代理通过 Model Context Protocol (MCP) 控制编辑器,使用 Epic 内置的 MCP 服务器以及 VibeUE 插件,后者提供了 31 个服务工具集和 85 项技能,用于生成演员、编辑蓝图、捕获视口图像、创作材质等。

代理会收到一个单一的高要求提示(PROMPT.md),要求其构建一个开放世界游戏。它可访问生产知识手册、21 个技能包,以及通过视口捕获和截图查看自身工作的工具。框架脚本负责启动编辑器、传递提示、在会话提前停止时恢复、在崩溃时重新启动编辑器,并监督长时间无人值守的运行。关键规则是:人类仅提供条件、资源和需求,绝不提供诊断、修复或答案。模型能否发现自身错误,正是被衡量的能力。

适用对象

希望在无法通过模式匹配伪造的长期、现实世界任务上评估前沿 AI 模型的研究人员和工程师。它也适用于研究代理能力(如因果推理、自我验证、系统思维、持续自主执行)的任何人。运行它需要一台搭载 Apple Silicon 的 macOS 机器、Xcode、Metal 工具链、Unreal Engine 以及经过认证的代理 CLI。

亮点

  • 测试标准基准遗漏的能力:现实世界理解、因果推理、长期执行、代码质量、自我验证、系统思维,以及在敌对环境(崩溃的编辑器、无声的工具失败)下工作的能力。
  • 代理通过 MCP 完全控制真实的 Unreal Engine 5 编辑器,借助 VibeUE 获得 31 个服务工具集和 85 项技能。
  • 代理拥有“眼睛”:视口捕获和截图使其能够检查自身工作,并修正看起来不真实的部分。
  • 框架与代理无关——您可以测试 Claude、Codex、Gemini 或任何自定义无头 CLI。
  • 包含无人值守监督脚本,具备指数退避、健康检查和安全重启逻辑。
  • 通过标准极高:一个陌生人看了也会觉得真实的地方,以及一个真正像游戏一样能打开的游戏。

相关