Calix-L/DanKS
RL‑Empowered Small‑Scale Competitive Guandan Agent
解決的問題
DanKS 是一個專為掌握複雜四人合作牌類遊戲「官丹」而設計的 AI 系統。它解決了處理龐大組合性動作空間的挑戰,以及長程信用分配問題——即某個動作的價值可能要數回合後才會顯現。
工作原理
該系統採用一個將遊戲狀態轉化為緊湊策略決策的流水線,包含四個主要步驟:
- 狀態編碼:處理可見手牌、行動歷史、合法動作和遊戲上下文。
- 結構化檢索:使用預算限制的分解搜尋,找出一組代表性候選動作,並總結其結構(長度、順子、花色等)。
- 評分:共享編碼器結合狀態與候選特徵,使執行者能夠對候選動作排序,評估者能夠估計狀態價值。
- 自對弈學習:使用近端策略優化(PPO)與廣義優勢估計(GAE)從遊戲軌跡中學習,提升 AI 偏好能帶來長期成功的動作的能力。
適用對象
本專案適合對遊戲 AI、強化學習,以及將 PPO 應用於大動作空間遊戲的 AI 研究人員和開發者。
亮點
- 三代演進:程式碼庫包含 V1(結構化檢索)、V2(學習選擇)和 V3(基於 PPO 的記憶感知策略學習)。
- 業界領先性能:在與基於規則和基於學習的官丹基線對比中,達到領先水準。
- 完整流水線:包含完整的官丹規則引擎、合法動作生成和訓練基礎設施。
- 硬體彈性:支援 CPU、NVIDIA CUDA 和 Ascend NPU 加速,可選 C++ 內核以實現更快的檢索。
相關
- 專案
- 專案
- 專案
- 專案