ukanwat/aaabench

A long-horizon benchmark harness: give a coding agent a real game engine, professional conditions and time, and ask it to build an open-world game. Harness only, no results.

何を解決するか

AAABench は、AI コーディングエージェントが完全で説得力のあるオープンワールドゲームをまったくの自力で構築できるかどうかを検証するベンチマークです。ほとんどのAIベンチマークは、狭いタスクを解くか、質問に答えることを求めます。一方、これはエージェントに実際のゲームエンジン、厳しい要件、そして数時間の非監視時間を与え、エージェントが都市を設計し、構築し、自らのミスに気づいて修正できるかどうかを測定します。人間の支援は一切不要です。

動作方法

ハーネスは、デフォルトで Claude を使用するコードエージェント(任意のヘッドレス CLI も可)を、リアルタイムの Unreal Engine 5 エディタに対して実行します。エージェントは Model Context Protocol (MCP) を通じてエディタを制御し、Epic の組み込み MCP サーバーと VibeUE プラグインを使用します。VibeUE は、アクターの生成、Blueprint の編集、ビューポート画像のキャプチャ、マテリアルの作成など、31 のサービスツールセットと 85 のスキルを追加します。

エージェントには、オープンワールドゲームの構築を依頼する単一の厳しいプロンプト(PROMPT.md)が渡されます。また、プロダクション知識のハンドブック、21 のスキルパック、ビューポートキャプチャやスクリーンショットを通じて自身の作業を確認できるツールも利用可能です。ハーネススクリプトはエディタを起動し、プロンプトを渡し、早期に停止した場合にセッションを再開し、クラッシュした場合はエディタを再起動し、長時間の非監視実行を監視します。重要なルールは、人間は条件、リソース、要件を提供するだけで、診断も修正も答えも一切行わないということです。モデルが自らのミスに気づくかどうかが、測定される能力です。

対象者

パターンマッチングでごまかせない、長期的な実世界タスクで先端AIモデルを評価したい研究者やエンジニア向けです。また、因果推論、自己検証、システム思考、持続的な自律実行といったエージェント能力を研究するすべての人にとって有用です。実行には Apple Silicon を搭載した macOS マシン、Xcode、Metal ツールチェーン、Unreal Engine、および認証済みのエージェント CLI が必要です。

特徴

  • 標準ベンチマークでは見逃されがちな能力をテスト:現実世界の理解、因果推論、長期的な実行、品質の高いコード作成、自己検証、システム思考、そして破壊的な環境(クラッシュするエディタ、静かに失敗するツール)での作業能力。
  • エージェントは MCP を通じて、VibeUE を介して 31 のサービスツールセットと 85 のスキルを持つ本物の Unreal Engine 5 エディタを完全に制御可能。
  • エージェントは「目」を持つ:ビューポートキャプチャとスクリーンショットにより、自身の作業を確認し、不自然な部分を修正可能。
  • ハーネスはエージェントに依存しない設計 — Claude、Codex、Gemini、または任意のカスタムヘッドレス CLI をテスト可能。
  • 指数バックオフ、健全性チェック、安全な再起動ロジックを備えた非監視監視スクリプトを含む。
  • 合格基準は非常に高い:見知らぬ人が見たときに「あり得る」と感じられる場所、そしてゲームのように開くゲームであること。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch