Pac-Bench:評估 LLM 一次性遊戲開發能力

Pac-Bench 揭示了一次性遊戲實現中的顯著性能差距

Pac-Bench 是一個專門設計的基準測試,用於檢驗前沿大型語言模型(LLMs)能否在單次提示中生成一個完全功能齊全、且與街機版高度一致的吃豆人(Pac-Man)克隆遊戲。結果顯示,模型的表現範圍廣泛,從幾乎完美的複製品到完全的語法錯誤不等。

Claude Opus 5.5 成為表現最佳者,獲得 99/100 分,緊隨其後的是 Claude Fable 5.1(96/100)和 Claude Sonnet 5.5(95/100)。相比之下,像 Minimax-m3 和 Muse-Glimmer-30b 這樣的模型表現顯著不佳,分別僅獲得 2/100 和 4/100 分。

各模型表現細分

頂級:高保真複製品

得分在 90 分以上的模型成功實現了核心機制,包括與街機版一致的鬼魂 AI、碰撞檢測以及複雜的音效系統。

  • Claude Opus 5.5(99/100): 幾乎達到完美。實現了包含低音線的完整兩段式開場,以及隨著進度提升而升高的持續警報聲,並加入了街機風格的死亡音效。
  • Claude Fable 5.1(96/100): 非常準確,但缺少獨立的強化彈音效,開場使用了通用琶音。
  • Claude Sonnet 5.5(95/100): 實現了多種控制方式(方向鍵、WASD、滑動),但音效表現較「單薄」,使用分開的提示音而非平滑的警報掃描音。
  • Grok-4.7(94/100): 成功實現了迷宮與鬼魂 AI,但在特定控制互動上失敗,例如在標題畫面忽略方向鍵輸入。

中級:可運行但有缺陷

得分介於 60 到 90 分之間的模型通常能產生可玩的遊戲,但存在明顯的機制或視覺錯誤。

  • GPT-5.6-sol(90/100): 缺少警報聲與靜音功能,且控制僅在方塊中心有效。
  • GLM-5.3-flash(88/100): 建立了一個較小的 19x21 迷宮,且在 Safari 中可能存在音效阻塞問題。
  • GPT-6-astra(87/100): 存在一個錯誤,復活的鬼魂在同一次強化週期內可被再次吃掉。
  • DeepSeek-v4.1-flash(72/100): 鬼魂 AI 完全失敗,受驚的鬼魂仍持續追趕吃豆人。

低級:無法運行的實現

得分低於 60 分的模型通常在基本空間邏輯上遇到困難,導致迷宮出現「死胡同」,或鬼魂生成後立即凍結。

  • Claude Opus 5(58/100): 受到繪製偏移錯誤影響,吃豆人與鬼魂出現在牆內。
  • Gemini-3.7-flash(38/100): 產生的遊戲中,吃豆人可透過螢幕外的欄位離開迷宮。
  • Grok-4.5(20/100): 生成的迷宮有 23 個死胡同與 10 個無法取得的豆子,使關卡無法完成。
  • Minimax-m3(2/100): 因語法錯誤導致畫布空白,完全失敗。

評分方法論

此基準測試根據五項主要技術標準評分:

  1. 控制(20 分): 支援多種輸入方式(鍵盤、滑動、點擊)與暫停功能。
  2. 鬼魂(25 分): 鬼魂 AI 模式與「眼睛回歸」動畫的準確性。
  3. 吃豆人移動(20 分): 確保角色不會卡在牆壁中。
  4. 迷宮完整性(20 分): 無死胡同與無法取得的豆子。
  5. 音效(15 分): 開場旋律、警報聲與死亡音效的實現。

社群分析與反駁意見

開發者與研究人員之間的討論指出,頂尖模型的高分可能歸因於訓練資料中存在大量吃豆人克隆遊戲,而非真正的推理能力。

"明顯現在使用了某種新的 RLAAS/資料集/環境……由於這個原因,這個基準測試的表現將在短時間內從 0 直接跳到 1。"

其他批評者認為,所使用的提示過於模糊,認為此基準測試實際上是在測試模型「補全缺失上下文」的能力,而非遵循嚴格技術規格的能力。部分開發者指出,雖然這些遊戲看起來像吃豆人,但往往缺乏手動實現時所需的原始街機鬼魂行為的 1:1 再現。

"LLM 實現會遺漏許多細節……鬼魂的行為與原始版本不一樣。如果我沒有自己實現過這個遊戲,我無法分辨差異。"

最後,一些使用者表達擔憂,認為 AI 能夠一次性生成複雜克隆遊戲的能力,可能讓新開發者失去學習遊戲程式設計基礎的動力,從而跳過「自己解決問題的樂趣」。

Sources

相關