Brood War Bench:LLM 在《星际争霸II》中对战——Codex Astra 领先,所有模型均处于初级水平
关键发现
Codex Astra (xhigh) 取得了 100 % 的完美胜率,但基准测试中的所有 LLM 表现均仅相当于初级玩家水平,无法执行持续的战略或有效防御简单攻击。
基准概述
"Brood War Bench" 基准测试将大型语言模型(LLMs)置于一个自定义的《星际争霸II:母巢之战》环境中进行对战,其中智能体直接发出游戏指令。每个模型在多个努力等级(低、中、xhigh)下运行,以衡量胜率、每分钟操作数(APM)以及每局游戏的货币成本。
排行榜概览
| 排名 | 模型 / 努力等级 | 胜 | 负 | APM | 每局成本 | 胜率 |
|---|---|---|---|---|---|---|
| 🥇 | Codex Astra / xhigh | 18 | 0 | 12.6 | $10.54 | 100 % |
| 🥈 | Codex Astra / 中 | 16 | 2 | 17.2 | $15.11 | 88.9 % |
| 🥉 | Claude Fable | 15 | 3 | 12.6 | $12.24 | 83.3 % |
| 4 | Codex Astra / 低 | 14 | 4 | 25.7 | $21.07 | 77.8 % |
| 5 | Codex 5.6 Sol / 中 | 13 | 5 | 10.1 | $5.12 | 72.2 % |
| … | … | … | … | … | … | … |
前三位均来自 OpenAI 的 Codex 系列,Claude Fable 是前五名中唯一的非 Codex 模型。
模型行为
Codex Astra – 积极破坏,宏观管理薄弱
"Codex 最强的重复策略是破坏。它经常派遣一个探测器横穿地图攻击工人或建筑,迫使对手浪费时间思考。" – Ben Swerdlov
- 速攻战术 – 早期探测器和单单位突袭多次让对手措手不及。
- 碎片化子智能体 – 经济、生产和战斗由独立的智能体处理,缺乏协调,导致零散攻击。
- 初级错误 – 单位被逐一派出,而非等待形成关键规模,限制了军队效率。
- 持续性 – 在一次失败中,Codex 5.6 Terra 搬迁了指挥中心并额外存活了六分钟,显示出避免立即失败的能力。
Claude Fable – 野心勃勃但未完成
"Fable 通常试图建立经济并升级科技树,而不是停留在首个可用单位上。" – Ben Swerdlov
- 长期规划 – 建造了高级科技(地堡、尖塔、突变虫、机械工厂、圣堂武士档案馆),有时能获胜。
- 执行差距 – 即使拥有强大科技,Fable 常常无法将升级转化为决定性军队(例如,达到工厂和学院,但仍被 Opus 5 淹没)。
Grok 4.6 – 思考过多,行动过少
"Grok 4.6 经常产生长时间的推理,但发出的指令批次极少。在一局 43 分钟的比赛中,它仅发出六次指令批次。" – Ben Swerdlov
- 低 APM – 平均 APM 为 11,很少投入战斗单位。
- 回合制错觉 – 模型表现得像游戏在推理时暂停,导致几乎没有有意义的战斗。
定量发现
| 指标 | Codex Astra (xhigh) | Claude Fable | Grok 4.6 |
|---|---|---|---|
| 平均 APM | 12.6 | 12.6 | 11.1 |
| 平均军队规模(单位数) | 8.3 | 7.6 | 2.0 |
| 平均建筑数 | 6.2 | 7.4 | 4.5 |
| 未使用矿物 | 240.6 | 248.6 | 536.6 |
| 胜率 | 100 % | 83.3 % | 0 % |
所有模型都让大量资源闲置,尤其是 Grok,平均每局未使用超过五十万矿物。
对决矩阵洞察
完整 19 × 19 矩阵(源码中链接)显示:
- Codex Astra (xhigh) 击败了所有其他配置。
- 即使最强的非 Codex 模型(Claude Fable)在两个努力等级下均败给 Codex Astra。
- Grok 从未赢得一局;其最佳结果是时间限制平局。
- Claude Opus 5 和 Claude Sonnet 仅在对阵低努力等级的 Codex 变体时取得适度胜率。
社区反应
"2010 年初,bwapi 刚兴起时曾举办过一场母巢之战 AI 锦标赛……有趣的是,当时的方法与现在或 DeepMind 的 SC2 研究相比差异巨大。" – @AntiRush
"这是这些系统有时花太多时间思考而变得无用的绝佳例子。" – @xyzsparetimexyz
"我非常想为《帝国时代2》创建一个类似的基准测试,但完全不知道如何让 AI 玩这个游戏。" – @windowshopping
"Astra 有明确的中/xhigh 等级,Fable 只有 Fable。使用了哪种推理层级?" – @leobuskin
评论突显了对经典《星际争霸》AI 锦标赛的怀旧之情,对当前实时与回合制框架的性质感到好奇,并建议将该基准扩展到其他即时战略或策略游戏。
基准测试运行方式
- 采用循环赛矩阵,将每个模型-努力等级配置与其他所有配置配对。
- 比赛在 Freestyle VM 上并行执行。
- 每局游戏均记录游戏引擎状态和智能体日志。
- 成本基于每个模型的 token 定价计算(例如,OpenAI token 价格、Claude token 价格)。
含义与未来方向
- 实时推理仍是瓶颈。 即使表现最佳的 LLM(Codex Astra)也依赖廉价的破坏战术,而非复杂的宏观管理。
- 成本-性能权衡明显。 更高的努力等级提升胜率,但也增加每局成本;一些低努力等级设置(如 Codex 5.6 Sol / 低)以极低成本实现了可观的胜率。
- 基准可扩展性。 社区兴趣表明,可将相同框架应用于其他即时战略游戏(如《帝国时代2》、《星际争霸II:重制版》)或回合制策略游戏(如 Go,参见 GoBench)。
- 模型架构至关重要。 Codex 中观察到的拆分子智能体模式提示了一种可能的架构改进:共享状态或协调层可缓解“一次一单位”的弱点。
自行对战
该基准测试公开可访问。用户可带来自己的智能体,与已发布的模型对战:
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch