Calix-L/DanKS

RL‑Empowered Small‑Scale Competitive Guandan Agent

해결하는 문제

DanKS는 복잡한 4인 협력형 카드 게임인 관단을 마스터하기 위해 설계된 AI 시스템입니다. 막대한 조합적 행동 공간을 관리하고, 몇 번의 턴이 지나야 비로소 한 수의 가치가 드러나는 장기적 보상 할당 문제를 해결합니다.

작동 방식

이 시스템은 게임 상태를 효율적인 정책 결정으로 변환하는 파이프라인을 네 가지 주요 단계로 구성합니다:

  1. 상태 인코딩: 가시적인 손패, 행동 이력, 합법적 수, 게임 컨텍스트를 처리합니다.
  2. 구조적 검색: 예산 제한된 분해 탐색을 사용하여 대표적인 후보 수를 찾아내며, 그 구조(길이, 시퀀스, 스위트 등)를 요약합니다.
  3. 점수 매기기: 공유 인코더가 상태와 후보 특징을 결합하여, 액터는 후보를 순위 매기고, 크리틱은 상태의 가치를 추정합니다.
  4. 자기 대전 학습: 일반화된 이점 추정(GAE)을 사용한 근접 정책 최적화(PPO)를 통해 게임 트래잭터리에서 학습하여, 장기적인 성공으로 이어지는 행동을 선호하는 능력을 향상시킵니다.

대상 사용자

이 프로젝트는 게임 AI, 강화 학습, 그리고 대규모 행동 공간을 가진 게임에 PPO를 적용하는 데 관심이 있는 AI 연구자 및 개발자에게 적합합니다.

주요 특징

  • 3세대 진화: 코드베이스에는 V1(구조적 검색), V2(학습된 선택), V3(PPO를 활용한 메모리 인식 정책 학습)가 포함되어 있습니다.
  • 최첨단 성능: 규칙 기반 및 학습 기반 관단 베이스라인과 비교해 최고 수준의 성과를 달성했습니다.
  • 포괄적인 파이프라인: 완전한 관단 규칙 엔진, 합법적 수 생성, 훈련 인프라가 포함되어 있습니다.
  • 하드웨어 유연성: CPU, NVIDIA CUDA, Ascend NPU 가속을 지원하며, 더 빠른 검색을 위한 선택적 C++ 커널도 제공됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트