ukanwat/aaabench

A long-horizon benchmark harness: give a coding agent a real game engine, professional conditions and time, and ask it to build an open-world game. Harness only, no results.

解決的問題

AAABench 是一個基準測試,用以檢驗 AI 編碼代理是否能完全獨立地建構一個真實可信的開放世界遊戲。大多數 AI 基準測試要求模型解決一個狹窄的任務或回答一個問題。而本基準測試則為代理提供一個真實的遊戲引擎、一個高難度的指令,以及數小時的非監督時間,然後衡量該代理是否能在沒有任何人類協助的情況下,自主設計城市、建構遊戲,並發現並修正自身的錯誤。

如何運作

該框架運行一個編碼代理(預設為 Claude,但任何無頭 CLI 均可),與一個即時的 Unreal Engine 5 編輯器互動。代理透過 Model Context Protocol (MCP) 控制編輯器,使用 Epic 內建的 MCP 伺服器以及 VibeUE 插件,後者提供了 31 個服務工具集和 85 項技能,用於生成角色、編輯藍圖、捕獲檢視口影像、創作材質等。

代理會收到一個單一的高難度提示(PROMPT.md),要求其建構一個開放世界遊戲。它可存取生產知識手冊、21 個技能套件,以及透過檢視口捕獲和截圖檢視自身工作的工具。框架腳本負責啟動編輯器、傳遞提示、在會話提前停止時恢復、在當機時重新啟動編輯器,並監督長時間非監督的運行。關鍵規則是:人類僅提供條件、資源和需求,絕不提供診斷、修復或答案。模型能否發現自身錯誤,正是被衡量的能力。

適用對象

希望在無法透過模式匹配偽造的長期、現實世界任務上評估前沿 AI 模型的研究人員和工程師。它也適用於研究代理能力(如因果推理、自我驗證、系統思維、持續自主執行)的任何人。執行它需要一台搭載 Apple Silicon 的 macOS 電腦、Xcode、Metal 工具鏈、Unreal Engine 以及經過認證的代理 CLI。

亮點

  • 測試標準基準所遺漏的能力:現實世界理解、因果推理、長期執行、程式碼品質、自我驗證、系統思維,以及在敵對環境(當機的編輯器、靜默失敗的工具)下工作的能力。
  • 代理透過 MCP 完全控制真實的 Unreal Engine 5 編輯器,藉助 VibeUE 獲得 31 個服務工具集和 85 項技能。
  • 代理擁有「眼睛」:檢視口捕獲和截圖使其能夠檢視自身工作,並修正看起來不真實的部分。
  • 框架與代理無關——您可以測試 Claude、Codex、Gemini 或任何自訂無頭 CLI。
  • 包含非監督監督腳本,具備指數退避、健康檢查和安全重啟邏輯。
  • 通過標準極高:一個陌生人看了也會覺得真實的地點,以及一個真正像遊戲一樣能開啟的遊戲。

相關