Ataraxos AI, 저예산으로 신념 네트워크를 사용하여 최고의 스트라테고 플레이어를 이기다

Ataraxos가 최고의 인간 스트라테고 플레이어를 물리치다

Ataraxos라는 AI 시스템은 세계 챔피언인 스트라테고 플레이어 Pim Niemeijer를 상대로 15승 1패(무승부 4회)를 기록하며, 불완전 정보 보드 게임도 막대한 컴퓨팅 예산 없이 정복할 수 있음을 증명했습니다.

숨겨진 정보가 스트라테고를 AI에게 어렵게 만드는 이유

스트라테고는 전투가 발생하기 전까지 각 말의 정체를 숨기며, 수천 번의 수에 걸쳐 펼쳐지는 "방대한 양의 숨겨진 정보"를 만들어냅니다. 40개의 말을 10의 33제곱(decillion) 이상의 조합으로 배치할 수 있는 이 게임의 상태 공간은 포커의 1,326가지 가능한 핸드보다 훨씬 큽니다. 이러한 불확실성의 깊이와 긴 게임 길이(종종 2,000수 이상), 그리고 블러핑 역학은 DeepMind의 DeepNash와 같은 이전의 AI 시도들이 신뢰할 수 있는 초인적 플레이를 달성하는 것을 방해했습니다.

핵심 기술적 돌파구: 신념 모델 신경망

Ataraxos는 이동 패턴으로부터 상대방의 숨겨진 말의 정체를 예측하는 두 번째 신경망을 추가합니다. 가능한 모든 보드 배치를 나열하는 대신, 신념 모델은 그럴듯한 숨겨진 상태를 샘플링하고, 각 샘플링된 상태에서 후보 수에 대해 제한된 탐색을 실행한 후, 기대 결과가 가장 좋은 수를 선택합니다. 이 접근 방식은 전체 정보 트리가 천문학적으로 큰 게임에서 전방 탐색을 가능하게 합니다.

"해결책은 상대방이 어떻게 움직였는지에 따라 숨겨진 말을 추측하도록 훈련된 두 번째 신경망, 즉 신념 모델이었습니다." – Gabriele Farina, MIT 공동 저자

훈련 효율성 및 규모

  • 자가 대국: 총 1억 6,300만 판, DeepNash보다 약 34배 적음.
  • 컴퓨팅: 16개의 GPU로 1주일, 신념 모델 훈련을 위해 4개의 GPU로 4일 소요.
  • 비용: 수천 달러 수준, 1,024개의 Google 맞춤형 칩을 사용한 DeepNash의 추정 비용 300만~450만 달러와 비교됨.
  • 시뮬레이터: 맞춤형 GPU 가속 엔진이 초당 수백만 수를 실행하여 빠른 강화 학습 업데이트를 가능하게 함.

Ataraxos의 게임 플레이 특성

  • 차분하고 체계적인 플레이 – 그리스어 ataraxos(평온)에서 이름을 따온 이 AI는 충동적인 도박을 피하고 확률이 낮은 위치에서도 천천히 회복합니다.
  • 효과적인 블러핑 – 신념 모델을 통해 AI는 상대방이 블러핑을 할 때만 합리적인 수를 두고, 인간보다 더 안정적으로 이를 수행할 수 있습니다.
  • 관습적이지 않은 깃발 배치 – 봇은 종종 깃발을 구석의 폭탄 두 개 뒤에 숨기는데, 이는 인간 전문가들이 거의 사용하지 않는 설정으로 상대방이 적응하도록 강요합니다.

Pim Niemeijer와의 경기 결과

  • 3주 동안 20번의 온라인 게임 진행; Niemeijer는 승리당 100달러를 획득함.
  • 최종 점수: Ataraxos 15승, Niemeijer 1승, 무승부 4회.
  • 유일한 인간의 승리는 운으로 간주됨; 완벽한 플레이를 하더라도 초기 말 배치에 따라 패배할 수 있음.

더 넓은 영향 및 확장

동일한 아키텍처가 다음 분야에서 성공을 거둠:

  • Barrage Stratego – 8개의 말로 진행하는 빠른 변형 게임, 3명의 세계 챔피언을 물리침.
  • Hanabi – 플레이어가 자신의 카드를 볼 수 없는 협동 카드 게임.
  • Dou dizhu – 인기 있는 중국 카드 게임, Ataraxos가 상위 봇들을 능가함.

연구진은 이 기술들이 숨겨진 정보의 단순화된 모델을 구축하는 것이 첫 번째 단계인 워게임, 협상 또는 금융 시장과 같은 실제 도메인으로 이전될 수 있다고 제안합니다.

남은 과제

  • 해석 가능성 – Ataraxos는 현재 특정 수를 선택한 이유를 설명할 수 없습니다. 팀은 전략을 더 투명하게 만들기 위해 노력하고 있습니다.
  • 일반화 – 신념 모델 탐색을 동적 규칙 세트나 지속적으로 확장되는 행동 공간(예: Magic: The Gathering)을 가진 게임에 적용하는 것은 여전히 해결되지 않은 문제입니다.

커뮤니티 반응 (Hacker News 하이라이트)

  • 사용자들은 DeepNash에 비해 컴퓨팅 자원이 극적으로 감소한 점에 주목했으며, 신념 모델에 대한 통찰력을 핵심 혁신으로 칭찬했습니다.

    "알고리즘은 또한 훨씬 더 빨리 학습했습니다. DeepNash보다 약 34배 적은 게임을 플레이하고도 훨씬 더 강력해졌습니다. 제 생각에 이것이 핵심이며 AI가 작동하게 만드는 요소입니다." – @janalsncm

  • 여러 댓글 작성자들은 개인적인 스트라테고 경험을 회상하며 이 게임이 체스나 바둑보다 더 오랫동안 AI의 도전을 견뎌냈다는 사실에 놀라움을 표했습니다.
  • 일부는 변형 규칙(예: "silent defense")과 이 접근 방식이 브리지와 같은 다른 불완전 정보 게임으로 확장될 수 있는지에 대해 질문을 제기했습니다.

향후 방향

저자들은 설명 가능성을 개선하고, 더 큰 규모의 숨겨진 정보 도메인을 탐색하며, Ataraxos 코드베이스(https://ataraxosai.github.io/ 에서 이용 가능)를 공개할 계획입니다. 그들의 결과는 정교한 신념 모델링이 과도한 하드웨어 비용 없이 인간의 직관과 기계 계산 사이의 격차를 좁힐 수 있음을 보여줍니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch