Brood War Bench:LLM 玩《星海爭霸 II》——Codex Astra 領先,所有模型僅達初學者水準
要點
Codex Astra (xhigh) 取得 100 % 的完美勝率,但此基準測試中所有 LLM 的表現僅達初學者水準,無法執行持續性的戰略或防禦簡單攻擊。
基準測試概覽
「Brood War Bench」基準測試將大型語言模型(LLM)置於自訂的《星海爭霸 II:母巢之戰》環境中對戰,其中代理程式直接發出遊戲指令。每個模型在多種努力等級(低、中、xhigh)下運行,以衡量勝率、每分鐘操作數(APM)以及每場遊戲的金錢成本。
排行榜摘要
| 排名 | 模型 / 努力等級 | 勝場 | 敗場 | APM | 每場成本 | 勝率 |
|---|---|---|---|---|---|---|
| 🥇 | Codex Astra / xhigh | 18 | 0 | 12.6 | $10.54 | 100 % |
| 🥈 | Codex Astra / 中 | 16 | 2 | 17.2 | $15.11 | 88.9 % |
| 🥉 | Claude Fable | 15 | 3 | 12.6 | $12.24 | 83.3 % |
| 4 | Codex Astra / 低 | 14 | 4 | 25.7 | $21.07 | 77.8 % |
| 5 | Codex 5.6 Sol / 中 | 13 | 5 | 10.1 | $5.12 | 72.2 % |
| … | … | … | … | … | … | … |
前三位皆來自 OpenAI 的 Codex 系列,Claude Fable 是前五名中唯一非 Codex 的模型。
模型行為
Codex Astra – 激進破壞,微弱宏觀管理
「Codex 最強的重複策略是破壞。它經常派遣一個探測者橫跨地圖攻擊工人或建築物,迫使對手浪費時間思考。」 – Ben Swerdlov
- 速攻策略 – 早期探測者與單單位突襲多次讓對手措手不及。
- 碎片化子代理 – 經濟、生產與戰鬥由獨立代理處理,缺乏協調,導致零散攻擊。
- 初學者錯誤 – 單位逐一派出,而非等待關鍵數量,限制了軍隊效能。
- 持續性 – 在一場敗仗中,Codex 5.6 Terra 搬遷指揮中心並存活六分鐘,展現避免立即失敗的能力。
Claude Fable – 野心勃勃但未完成
「Fable 通常試圖建立經濟並提升科技樹,而非僅停留在第一個可用單位。」 – Ben Swerdlov
- 長期規劃 – 建造先進科技(地窖、尖塔、突變蟲;機器人設施、聖堂武士檔案館),有時成功獲勝。
- 執行落差 – 即使擁有強大科技,Fable 常無法將升級轉化為決定性軍隊(例如,達到工廠與學院,卻被 Opus 5 淹沒)。
Grok 4.6 – 想太多,做太少
「Grok 4.6 經常產生長時間的推理,但發出的指令批次極少。在一場 43 分鐘的遊戲中,僅發出六次指令批次。」 – Ben Swerdlov
- 低 APM – 平均 11 APM,很少投入戰鬥單位。
- 回合制錯覺 – 模型表現得像遊戲因推理而暫停,導致無意義的戰鬥。
數量化發現
| 指標 | Codex Astra (xhigh) | Claude Fable | Grok 4.6 |
|---|---|---|---|
| 平均 APM | 12.6 | 12.6 | 11.1 |
| 平均軍隊規模(單位數) | 8.3 | 7.6 | 2.0 |
| 平均建築數 | 6.2 | 7.4 | 4.5 |
| 未使用的礦物 | 240.6 | 248.6 | 536.6 |
| 勝率 | 100 % | 83.3 % | 0 % |
所有模型都讓大量資源閒置,尤其是 Grok,平均留下超過五十萬礦物未使用。
頭對頭矩陣洞察
完整 19 × 19 矩陣(來源連結中提供)顯示:
- Codex Astra (xhigh) 擊敗所有其他配置。
- 即使是表現最強的非 Codex 模型(Claude Fable),在兩個努力等級下皆敗給 Codex Astra。
- Grok 無一勝績;其最佳成績為時間限制平局。
- Claude Opus 5 與 Claude Sonnet 僅在對抗較低努力等級的 Codex 變體時取得輕微勝率。
社群反應
「回溯到 2010 年,bwapi 初期有過一場母巢之戰 AI 開放賽……很有趣看到當時的方法與現在或 DeepMind 的 SC2 研究有多不同。」 – @AntiRush
「這是這些系統有時花太多時間思考,反而無用的很好範例。」 – @xyzsparetimexyz
「我非常想為《世紀帝國 II》創建這樣的基準測試,但完全不知道如何讓 AI 玩這款遊戲。」 – @windowshopping
「Astra 明確區分中/高努力等級,Fable 則僅有 Fable。使用的是哪種推理層級?」 – @leobuskin
這些評論突顯了對經典《星海爭霸》AI 開放賽的懷舊之情,對此基準測試即時性與回合制差異的好奇,以及建議將此基準擴展至其他即時戰略或策略遊戲。
基準測試執行方式
- 以循環賽制將每個模型-努力等級配置與其他所有配置對戰。
- 比賽在 Freestyle VM 上並行執行。
- 每場遊戲皆記錄遊戲引擎狀態與代理日誌。
- 成本根據各模型的 token 定價計算(例如 OpenAI token 價格、Claude token 價格)。
意義與未來方向
- 即時推理仍是瓶頸。 即使表現最佳的 LLM(Codex Astra)仍依賴便宜的破壞策略,而非複雜的宏觀管理。
- 成本-效能權衡明顯。 更高努力等級提升勝率,但也增加每場成本;部分較低努力等級(如 Codex 5.6 Sol / 低)在成本僅為數分之一的情況下,仍取得可觀勝率。
- 基準可擴展性。 社群興趣顯示可將相同架構應用於其他即時戰略遊戲(《世紀帝國 II》、《星海爭霸 II:重製版》)或回合制策略遊戲(如 Go,見 GoBench)。
- 模型架構至關重要。 Codex 中觀察到的分離子代理模式暗示可能的架構改進:共享狀態或協調層可緩解「一次一單位」的弱點。
自己試試看對戰
此基準測試公開可訪問。使用者可帶來自己的代理,與已發表的模型對戰:
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch