Brood War Bench:LLM 玩《星海爭霸 II》——Codex Astra 領先,所有模型僅達初學者水準

要點

Codex Astra (xhigh) 取得 100 % 的完美勝率,但此基準測試中所有 LLM 的表現僅達初學者水準,無法執行持續性的戰略或防禦簡單攻擊。


基準測試概覽

「Brood War Bench」基準測試將大型語言模型(LLM)置於自訂的《星海爭霸 II:母巢之戰》環境中對戰,其中代理程式直接發出遊戲指令。每個模型在多種努力等級(低、中、xhigh)下運行,以衡量勝率、每分鐘操作數(APM)以及每場遊戲的金錢成本。

排行榜摘要

排名 模型 / 努力等級 勝場 敗場 APM 每場成本 勝率
🥇 Codex Astra / xhigh 18 0 12.6 $10.54 100 %
🥈 Codex Astra / 中 16 2 17.2 $15.11 88.9 %
🥉 Claude Fable 15 3 12.6 $12.24 83.3 %
4 Codex Astra / 低 14 4 25.7 $21.07 77.8 %
5 Codex 5.6 Sol / 中 13 5 10.1 $5.12 72.2 %

前三位皆來自 OpenAI 的 Codex 系列,Claude Fable 是前五名中唯一非 Codex 的模型。


模型行為

Codex Astra – 激進破壞,微弱宏觀管理

「Codex 最強的重複策略是破壞。它經常派遣一個探測者橫跨地圖攻擊工人或建築物,迫使對手浪費時間思考。」 – Ben Swerdlov

  • 速攻策略 – 早期探測者與單單位突襲多次讓對手措手不及。
  • 碎片化子代理 – 經濟、生產與戰鬥由獨立代理處理,缺乏協調,導致零散攻擊。
  • 初學者錯誤 – 單位逐一派出,而非等待關鍵數量,限制了軍隊效能。
  • 持續性 – 在一場敗仗中,Codex 5.6 Terra 搬遷指揮中心並存活六分鐘,展現避免立即失敗的能力。

Claude Fable – 野心勃勃但未完成

「Fable 通常試圖建立經濟並提升科技樹,而非僅停留在第一個可用單位。」 – Ben Swerdlov

  • 長期規劃 – 建造先進科技(地窖、尖塔、突變蟲;機器人設施、聖堂武士檔案館),有時成功獲勝。
  • 執行落差 – 即使擁有強大科技,Fable 常無法將升級轉化為決定性軍隊(例如,達到工廠與學院,卻被 Opus 5 淹沒)。

Grok 4.6 – 想太多,做太少

「Grok 4.6 經常產生長時間的推理,但發出的指令批次極少。在一場 43 分鐘的遊戲中,僅發出六次指令批次。」 – Ben Swerdlov

  • 低 APM – 平均 11 APM,很少投入戰鬥單位。
  • 回合制錯覺 – 模型表現得像遊戲因推理而暫停,導致無意義的戰鬥。

數量化發現

指標 Codex Astra (xhigh) Claude Fable Grok 4.6
平均 APM 12.6 12.6 11.1
平均軍隊規模(單位數) 8.3 7.6 2.0
平均建築數 6.2 7.4 4.5
未使用的礦物 240.6 248.6 536.6
勝率 100 % 83.3 % 0 %

所有模型都讓大量資源閒置,尤其是 Grok,平均留下超過五十萬礦物未使用。


頭對頭矩陣洞察

完整 19 × 19 矩陣(來源連結中提供)顯示:

  • Codex Astra (xhigh) 擊敗所有其他配置。
  • 即使是表現最強的非 Codex 模型(Claude Fable),在兩個努力等級下皆敗給 Codex Astra。
  • Grok 無一勝績;其最佳成績為時間限制平局。
  • Claude Opus 5 與 Claude Sonnet 僅在對抗較低努力等級的 Codex 變體時取得輕微勝率。

社群反應

「回溯到 2010 年,bwapi 初期有過一場母巢之戰 AI 開放賽……很有趣看到當時的方法與現在或 DeepMind 的 SC2 研究有多不同。」 – @AntiRush

「這是這些系統有時花太多時間思考,反而無用的很好範例。」 – @xyzsparetimexyz

「我非常想為《世紀帝國 II》創建這樣的基準測試,但完全不知道如何讓 AI 玩這款遊戲。」 – @windowshopping

「Astra 明確區分中/高努力等級,Fable 則僅有 Fable。使用的是哪種推理層級?」 – @leobuskin

這些評論突顯了對經典《星海爭霸》AI 開放賽的懷舊之情,對此基準測試即時性與回合制差異的好奇,以及建議將此基準擴展至其他即時戰略或策略遊戲。


基準測試執行方式

  • 以循環賽制將每個模型-努力等級配置與其他所有配置對戰。
  • 比賽在 Freestyle VM 上並行執行。
  • 每場遊戲皆記錄遊戲引擎狀態與代理日誌。
  • 成本根據各模型的 token 定價計算(例如 OpenAI token 價格、Claude token 價格)。

意義與未來方向

  • 即時推理仍是瓶頸。 即使表現最佳的 LLM(Codex Astra)仍依賴便宜的破壞策略,而非複雜的宏觀管理。
  • 成本-效能權衡明顯。 更高努力等級提升勝率,但也增加每場成本;部分較低努力等級(如 Codex 5.6 Sol / 低)在成本僅為數分之一的情況下,仍取得可觀勝率。
  • 基準可擴展性。 社群興趣顯示可將相同架構應用於其他即時戰略遊戲(《世紀帝國 II》、《星海爭霸 II:重製版》)或回合制策略遊戲(如 Go,見 GoBench)。
  • 模型架構至關重要。 Codex 中觀察到的分離子代理模式暗示可能的架構改進:共享狀態或協調層可緩解「一次一單位」的弱點。

自己試試看對戰

此基準測試公開可訪問。使用者可帶來自己的代理,與已發表的模型對戰:

玩 Brood War

Sources

相關