Calix-L/DanKS

RL‑Empowered Small‑Scale Competitive Guandan Agent

解決的問題

DanKS 是一個專為掌握複雜四人合作牌類遊戲「官丹」而設計的 AI 系統。它解決了處理龐大組合性動作空間的挑戰,以及長程信用分配問題——即某個動作的價值可能要數回合後才會顯現。

工作原理

該系統採用一個將遊戲狀態轉化為緊湊策略決策的流水線,包含四個主要步驟:

  1. 狀態編碼:處理可見手牌、行動歷史、合法動作和遊戲上下文。
  2. 結構化檢索:使用預算限制的分解搜尋,找出一組代表性候選動作,並總結其結構(長度、順子、花色等)。
  3. 評分:共享編碼器結合狀態與候選特徵,使執行者能夠對候選動作排序,評估者能夠估計狀態價值。
  4. 自對弈學習:使用近端策略優化(PPO)與廣義優勢估計(GAE)從遊戲軌跡中學習,提升 AI 偏好能帶來長期成功的動作的能力。

適用對象

本專案適合對遊戲 AI、強化學習,以及將 PPO 應用於大動作空間遊戲的 AI 研究人員和開發者。

亮點

  • 三代演進:程式碼庫包含 V1(結構化檢索)、V2(學習選擇)和 V3(基於 PPO 的記憶感知策略學習)。
  • 業界領先性能:在與基於規則和基於學習的官丹基線對比中,達到領先水準。
  • 完整流水線:包含完整的官丹規則引擎、合法動作生成和訓練基礎設施。
  • 硬體彈性:支援 CPU、NVIDIA CUDA 和 Ascend NPU 加速,可選 C++ 內核以實現更快的檢索。

相關

  • 專案
  • 專案
  • 專案
  • 專案