Ataraxos AIが信念モデルと低コスト学習を用いてStrategoのトッププレイヤーを撃破

Ataraxosが世界最高のStrategoプレイヤーを撃破

要点: カーネギーメロン大学、MIT、NYU、スタンフォード大学の研究者によって構築されたAI「Ataraxos」は、わずか数千ドルの費用と16基のGPUによる学習で、Strategoのトップ人間プレイヤーを15勝1敗(4引き分け)で破りました。


なぜStrategoはAIにとって困難な問題だったのか

Strategoは不完全情報ボードゲームです。各プレイヤーは相手の駒の位置は知っていますが、そのランク(強さ)は分かりません。40個の駒は10の33乗(decillion)を超える組み合わせで配置可能であり、典型的なゲームは最大2,000手に及ぶこともあります。この膨大な隠れた状態空間と長い時間軸の組み合わせにより、DeepMindの2022年の「DeepNash」のような以前の試みでは、トップレベルの人間を安定して打ち負かすことはできませんでした。

「Strategoには非常に際立った特徴があります。それは、非常に長い時間軸の中で展開される膨大な量の隠れた情報です」 – Eugene Vinitsky, NYU (Ars Technica).

技術的な核心:信念ネットワーク

このブレイクスルーは、移動履歴から相手の隠れた駒の正体を予測する2つ目のニューラルネットワークを追加したことにあります。Ataraxosは、考えられるすべての盤面構成を列挙するのではなく、この信念モデルから妥当な隠れた状態をサンプリングし、それぞれに対して限定的な先読み探索を行い、期待される結果が最も良い手を選択します。

「その解決策は、相手がどのように動いたかに基づいて隠れた駒を推測するように訓練された、2つ目のニューラルネットワークである信念モデルでした」 – Gabriele Farina, MIT.

学習体制と効率性

  • 自己対戦ゲーム数: 合計1億6300万回。DeepNashの数十億回よりもはるかに少ない。
  • カリキュラム学習: 初期には大きな戦略的調整を行い、後から微調整を行う。
  • ハードウェア: 16基のGPUで1週間、さらに信念モデルの学習に4基のGPUで4日間。
  • コスト: 数千米ドル。GoogleのTPUポッドを使用したDeepNashの推定300万〜450万ドルと比較して非常に安価。

著者らは、この高速化の要因を、コンシューマーグレードのGPU上で毎秒数百万手を処理できるカスタムシミュレーターにあるとしています。

Pim Niemeijerとの対戦結果

  • 3週間で20回のオンライン対戦。
  • Ataraxosが15勝、4引き分け、1敗。
  • Niemeijerは1勝につき100ドルを獲得。唯一の人間側の勝利は、体系的な弱さではなく運によるものとされました。
  • 2025年のStratego世界選手権では、Ataraxosは40戦中38勝を挙げ、旗を爆弾2つの後ろにのみ配置するといったメタ戦略に影響を与えました。

ゲームプレイの特徴

  • 冷静で計画的なプレイ – AIは衝動的なギャンブルを避け、勝率の低い局面から着実に回復することを好みます。
  • 恐れを知らないブラフ – AIは自身の隠れた状態を把握しているため、人間なら絶望的な状況でしか試さないようなブラフを実行し、より確実にそれを遂行できます。
  • メタゲームへの影響 – Ataraxosの成功を目の当たりにした人間プレイヤーたちは、型破りな旗の配置パターンを採用するようになりました。

アーキテクチャの汎用性

同じ「信念ネットワーク+探索」のフレームワークが以下にも適用されました。

  • Barrage Stratego (8個の駒を使う高速バリアント) – 3人の世界チャンピオンを撃破。
  • Hanabi – 協力型カードゲームで最先端のパフォーマンスを達成。
  • Dou dizhu – 中国のカードゲームにおいて、既存の最強ボットを上回る性能を発揮。 チームは、このアプローチを交渉、金融市場、ウォーゲームシミュレーションなど、より動的な領域に拡張する計画です。

制限事項と今後の課題

  • 解釈可能性 – Ataraxosは現在、なぜ特定の手を選択したのかを説明できません。研究者たちは、より透明性の高い戦略の開発を目指しています。
  • 現実世界の複雑さ – ボードゲームには固定されたルールと明確な勝利条件がありますが、現実の交渉にはそのような明確な目的が欠けています。著者らは、単純化されたモデルを構築することが、ゲーム以外の分野にこれらの技術を適用するための必要な第一歩であると主張しています。

Hacker Newsでのコミュニティの反応

  • ユーザーは隠れた情報の膨大さを強調しました。「Strategoでは、盤上の40個の駒がどのような順序でもあり得る…10の33乗を超える配置の可能性がある。」
  • 複数のコメント投稿者が効率性の向上に注目しました。「このアルゴリズムは学習もはるかに高速でした。DeepNashよりも約34倍少ないゲーム数で、より強力な結果を残しました。」
  • ゲームへのノスタルジーやAIを自分で試してみたいという好奇心を示す声がある一方で、DeepMindの以前の試みやゲームのメタ戦略への影響について疑問を呈する声もありました。

結論: 自己対戦強化学習と隠れた情報のための専用信念モデルを組み合わせることで、Ataraxosは長年のAIの課題を解決しました。以前の取り組みと比較してわずかな計算コストでStrategoの世界トッププレイヤーを打ち負かし、不完全情報領域におけるスケーラブルな道筋を示しました。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch