Pac-Bench:评估大语言模型一次性游戏开发能力
Pac-Bench 揭示了一次性游戏实现中的显著性能差距
Pac-Bench 是一个基准测试,旨在检验前沿大型语言模型(LLMs)在单次生成中创建一个功能完整、街机级准确的吃豆人(Pac-Man)克隆版本的能力。结果表明,模型表现呈现出广泛的能力差异,从近乎完美的复刻到完全的语法错误不等。
Claude Opus 5.5 成为表现最佳者,得分 99/100,紧随其后的是 Claude Fable 5.1(96/100)和 Claude Sonnet 5.5(95/100)。相比之下,Minimax-m3 和 Muse-Glimmer-30b 等模型表现显著不佳,得分分别为 2/100 和 4/100。
按模型划分的性能分析
顶级:高保真复刻
得分在 90+ 的模型成功实现了核心机制,包括街机级准确的幽灵 AI、碰撞检测以及复杂的音频系统。
- Claude Opus 5.5 (99/100):几乎达到完美。实现了包含低音线的完整两段式开场,以及随进度上升的持续警报声,还有街机风格的死亡音效。
- Claude Fable 5.1 (96/100):高度准确,但缺少独立的超级豆音效,并使用通用琶音作为开场。
- Claude Sonnet 5.5 (95/100):实现了多种控制方式(方向键、WASD、滑动),但音效表现“更单薄”,用独立的哔声代替了平滑的警报扫音。
- Grok-4.7 (94/100):成功实现了迷宫和幽灵 AI,但在特定控制交互上失败,例如在标题屏幕上忽略方向键输入。
中等水平:功能完整但存在缺陷
得分在 60 到 90 之间的模型通常能生成可玩的游戏,但存在明显的机制或视觉缺陷。
- GPT-5.6-sol (90/100):缺少警报声和静音功能,且控制仅在格子中心有效。
- GLM-5.3-flash (88/100):创建了一个更小的 19x21 迷宫,并在 Safari 浏览器中可能存在音频阻塞问题。
- GPT-6-astra (87/100):存在一个漏洞,复活的幽灵在同一个超级豆周期内可被再次吃掉。
- DeepSeek-v4.1-flash (72/100):幽灵 AI 完全失败,惊恐状态下的幽灵仍持续追逐吃豆人。
低水平:非功能性实现
得分低于 60 的模型通常在基本空间逻辑上遇到困难,导致迷宫中出现“死胡同”,或幽灵生成后即冻结。
- Claude Opus 5 (58/100):存在绘图偏移错误,导致吃豆人和幽灵出现在墙壁内部。
- Gemini-3.7-flash (38/100):生成的游戏允许吃豆人通过屏幕外的列离开迷宫。
- Grok-4.5 (20/100):生成的迷宫包含 23 个死胡同和 10 个无法触及的豆子,导致关卡无法通关。
- Minimax-m3 (2/100):因语法错误导致画布空白,完全失败。
评分方法论
该基准测试基于五个主要技术标准对模型进行评估:
- 控制(20 分):支持多种输入方式(键盘、滑动、点击)及暂停功能。
- 幽灵(25 分):幽灵 AI 模式和“眼睛”返回动画的准确性。
- 吃豆人移动(20 分):确保角色不会卡在墙壁中。
- 迷宫完整性(20 分):无死胡同和无法触及的豆子。
- 音效(15 分):开场旋律、警报声和死亡音效的实现。
社区分析与反驳观点
开发者和研究人员之间的讨论表明,顶级模型的高分可能归因于训练数据中大量吃豆人克隆的存在,而非真正的推理能力。
"显然现在使用了某些新的 RLAAS/数据集/环境……由于这个原因,这个基准测试的分数很快就会从 0→1。"
其他批评者认为,所用提示过于模糊,暗示该基准测试测试的是模型“填补缺失上下文”的能力,而非严格遵循技术规范的能力。一些开发者指出,尽管这些游戏看起来像吃豆人,但通常缺乏手动实现所必需的原始街机幽灵行为模式的 1:1 复刻。
"LLM 实现会丢失大量细节……幽灵的行为与原始版本不同。如果我没有亲自实现过这个游戏,我无法察觉其中的差异。"
最后,一些用户表达了担忧:AI 能够一次性生成复杂克隆,可能会让新手开发者失去学习游戏编程基础的动力,从而跳过“自己摸索的乐趣”。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch