Ataraxos AI 以低預算利用信念網路擊敗頂尖 Stratego 玩家
Ataraxos 擊敗了人類最強的 Stratego 玩家
名為 Ataraxos 的 AI 系統以 15 勝 1 敗(外加 4 場平手)的戰績擊敗了世界冠軍 Stratego 玩家 Pim Niemeijer,證明了在無需龐大運算預算的情況下,也能精通非完美資訊的棋盤遊戲。
為什麼隱藏資訊讓 Stratego 對 AI 來說很困難
Stratego 在戰鬥發生前會隱藏每枚棋子的身份,創造出在數千步棋中不斷展開的「大量隱藏資訊」。由於 40 枚棋子可以排列出超過 10 的 30 次方種配置,該遊戲的狀態空間遠大於撲克牌的 1,326 種可能手牌。這種不確定性的深度,加上漫長的遊戲長度(通常超過 2,000 步)以及虛張聲勢的博弈動態,使得 DeepMind 的 DeepNash 等先前的 AI 嘗試無法實現可靠的超越人類表現。
核心技術突破:信念模型神經網路
Ataraxos 增加了一個第二神經網路,根據移動模式預測對手的隱藏棋子身份。信念模型並非列舉所有可能的棋盤排列,而是對合理的隱藏狀態進行採樣,在每個採樣狀態下對候選走法進行有限的搜尋,並選擇預期結果最好的走法。這種方法使得在資訊樹極其龐大的遊戲中進行前向搜尋成為可能。
「解決方案是第二個神經網路,即信念模型,它經過訓練,可以根據對手的移動方式來猜測其隱藏的棋子。」 – Gabriele Farina, MIT 共同作者
訓練效率與規模
- 自對弈遊戲:總計 1.63 億局,比 DeepNash 少約 34 倍。
- 運算資源:16 張 GPU 訓練一週,外加 4 張 GPU 訓練四天以完成信念模型。
- 成本:數千美元,相比之下 DeepNash 在 1,024 個 Google 客製化晶片上估計花費 300 萬至 450 萬美元。
- 模擬器:客製化的 GPU 加速引擎每秒可運行數百萬步,實現快速的強化學習更新。
Ataraxos 的遊戲特性
- 冷靜、有條理的打法 – 以希臘語 ataraxos(平靜)命名,該 AI 避免衝動的賭博,並能從低機率的局面中緩慢恢復。
- 有效的虛張聲勢 – 信念模型讓 AI 能夠做出只有在對手虛張聲勢時才合理的走法,並且比人類更可靠地執行後續行動。
- 非傳統的旗幟放置 – 該機器人經常將旗幟隱藏在角落的兩枚炸彈後面,這種設置很少被人類專家使用,迫使對手必須做出調整。
對戰 Pim Niemeijer 的比賽結果
- 三週內進行了 20 場線上比賽;Niemeijer 每贏一場可獲得 100 美元。
- 最終比分:Ataraxos 15 勝,Niemeijer 1 勝,4 場平手。
- 唯一的一場人類勝利歸因於運氣;即使是完美的走法也可能因為隨機的初始棋子排列而輸掉。
更廣泛的影響與擴展
相同的架構在以下領域取得了成功:
- Barrage Stratego – 一種八枚棋子的快速變體,擊敗了三位世界冠軍。
- Hanabi – 一種合作紙牌遊戲,玩家無法看到自己的牌。
- 鬥地主 – 一種流行的中國紙牌遊戲,Ataraxos 的表現優於頂尖機器人。
研究人員認為,這些技術可以轉移到現實世界的領域,例如兵棋推演、談判或金融市場,在這些領域中,建立隱藏資訊的簡化模型是第一步。
剩餘挑戰
- 可解釋性 – Ataraxos 目前無法解釋為什麼選擇特定的走法;團隊正致力於讓策略更加透明。
- 泛化能力 – 將信念模型搜尋應用於具有動態規則集或不斷擴展動作空間的遊戲(例如 Magic: The Gathering)仍然是一個未解的問題。
社群反應(Hacker News 重點)
- 用戶注意到與 DeepNash 相比,運算需求大幅降低,並稱讚信念模型的洞察力是關鍵創新。
「該演算法的學習速度也快得多——它玩的遊戲局數比 DeepNash 少了約 34 倍,但最終卻強大得多。我認為,這是關鍵所在,也是讓 AI 能夠運作的原因。」 – @janalsncm
- 幾位評論者回憶起個人的 Stratego 經驗,並對該遊戲比西洋棋或圍棋更難被 AI 攻克感到驚訝。
- 一些人提出了關於變體規則(例如「靜默防禦」)的問題,以及該方法是否可以擴展到橋牌等其他非完美資訊遊戲。
未來方向
作者計劃提高可解釋性,探索更大規模的隱藏資訊領域,並發布 Ataraxos 程式碼庫(可在 https://ataraxosai.github.io/ 取得)。他們的研究結果證明,複雜的信念建模可以在不產生高昂硬體成本的情況下,縮小人類直覺與機器計算之間的差距。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch