Calix-L/DanKS

RL‑Empowered Small‑Scale Competitive Guandan Agent

何を解決するか

DanKS は、複雑な4人協力型カードゲームである『官丹』をマスターするためのAIシステムです。膨大で組み合わせ的な行動空間の管理と、長距離の報酬割り当て(ある手の価値が数ターン後にしか明らかにならない)という課題に対処しています。

動作方法

このシステムは、ゲーム状態をコンパクトな方策決定に変換するパイプラインを4つの主要ステップで構成しています:

  1. 状態エンコーディング:可視手札、行動履歴、合法手、ゲームコンテキストを処理します。
  2. 構造的リトリーブ:予算付き分解探索を使用して、代表的な候補手の集合を検索し、その構造(長さ、シーケンス、スートなど)を要約します。
  3. スコアリング:共有エンコーダーが状態と候補特徴を統合し、エクサーやクリティックが候補をランク付け、状態の価値を推定します。
  4. 自己対戦学習:一般化されたアドバンテージ推定(GAE)を用いたProximal Policy Optimization(PPO)により、ゲームの軌道から学習し、長期的な成功につながる行動を優先する能力を向上させます。

対象ユーザー

このプロジェクトは、ゲームAI、強化学習、および大規模行動空間を持つゲームへのPPOの応用に興味を持つAI研究者や開発者向けです。

特徴

  • 3世代の進化:コードベースにはV1(構造的リトリーブ)、V2(学習による選択)、V3(PPOを用いたメモリ意識型方策学習)が含まれます。
  • 最先端のパフォーマンス:ルールベースおよび学習ベースの官丹ベースラインに対して、トップクラスの結果を達成しています。
  • 包括的なパイプライン:完全な官丹ルールエンジン、合法手生成、トレーニングインフラが含まれます。
  • ハードウェアの柔軟性:CPU、NVIDIA CUDA、Ascend NPUの加速をサポートし、高速リトリーブ用のオプションC++カーネルも利用可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト