ukanwat/aaabench

A long-horizon benchmark harness: give a coding agent a real game engine, professional conditions and time, and ask it to build an open-world game. Harness only, no results.

해결하는 문제

AAABench는 AI 코드 에이전트가 완전하고 신뢰할 수 있는 오픈월드 비디오 게임을 완전히 자율적으로 구축할 수 있는지 테스트하는 벤치마크입니다. 대부분의 AI 벤치마크는 모델이 좁은 작업을 해결하거나 질문에 답하도록 요구합니다. 그러나 이 벤치마크는 에이전트에게 실제 게임 엔진, 과제의 난이도가 높은 지시, 그리고 수시간의 비감독 시간을 제공한 후, 에이전트가 도시를 설계하고 구축하며, 스스로의 실수를 인지하고 수정할 수 있는지 여부를 측정합니다. 인간의 개입은 전혀 없습니다.

작동 방식

하네스는 기본적으로 Claude를 사용하는 코드 에이전트(또는 헤드리스 CLI라면 어떤 것도 가능)를 실시간 Unreal Engine 5 에디터와 연결합니다. 에이전트는 Epic의 내장 MCP 서버와 VibeUE 플러그인을 사용하여 Model Context Protocol (MCP)를 통해 에디터를 제어합니다. VibeUE는 액터 생성, Blueprint 편집, 뷰포트 이미지 캡처, 매터리얼 제작 등 31개의 서비스 툴셋과 85개의 기능을 추가합니다.

에이전트는 오픈월드 게임을 구축하라는 단일한 과제 지시(PROMPT.md)를 받습니다. 또한 프로덕션 지식 핸드북, 21개의 기능 팩, 뷰포트 캡처 및 스크린샷을 통해 자신의 작업을 확인할 수 있는 도구에 접근할 수 있습니다. 하네스 스크립트는 에디터를 부팅하고 지시를 전달하며, 조기 중단 시 세션을 재개하고, 충돌 시 에디터를 재시작하며, 장시간 비감독 실행을 감시합니다. 핵심 규칙은 인간이 조건, 자원, 요구사항만 제공하고, 진단도, 수정도, 답도 제공하지 않는다는 것입니다. 모델이 스스로의 실수를 인지하는지 여부가 측정되는 능력입니다.

대상 사용자

패턴 매칭으로 위장할 수 없는 장기적인 실세계 작업에서 최전선 AI 모델을 평가하고자 하는 연구자 및 엔지니어를 위한 것입니다. 또한 인과적 사고, 자기 검증, 시스템 사고, 지속적인 자율 실행과 같은 에이전트 능력을 연구하는 모든 사람에게 유용합니다. 실행에는 Apple Silicon을 탑재한 macOS 기계, Xcode, Metal 툴체인, Unreal Engine, 인증된 에이전트 CLI가 필요합니다.

주요 특징

  • 표준 벤치마크가 놓치는 능력 테스트: 실제 세계 이해, 인과적 사고, 장기적 실행, 품질 높은 코드 작성, 자기 검증, 시스템 사고, 그리고 파괴적인 환경(충돌하는 에디터, 침묵하는 도구 실패)에서의 작업 능력.
  • 에이전트는 VibeUE를 통해 31개의 서비스 툴셋과 85개의 기능을 갖춘 실제 Unreal Engine 5 에디터를 MCP를 통해 완전히 제어할 수 있습니다.
  • 에이전트는 '눈'이 있습니다: 뷰포트 캡처와 스크린샷을 통해 자신의 작업을 검토하고, 비현실적인 부분을 수정할 수 있습니다.
  • 하네스는 에이전트에 독립적입니다 — Claude, Codex, Gemini 또는 어떤 커스텀 헤드리스 CLI도 테스트 가능합니다.
  • 지수 백오프, 건강 체크, 안전한 재시작 로직을 포함한 비감독 감시 스크립트 포함.
  • 합격 기준은 매우 높습니다: 낯선 사람이 봐도 '진짜처럼 보이는' 장소, 그리고 게임처럼 열리는 게임.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch
  • Dispatch