Calix-L/DanKS
RL‑Empowered Small‑Scale Competitive Guandan Agent
解决的问题
DanKS 是一个专为掌握复杂四人合作牌类游戏「官丹」而设计的 AI 系统。它解决了处理巨大组合性动作空间的挑战,以及长程信用分配问题——即某个动作的价值可能要数轮之后才显现。
工作原理
该系统采用一个将游戏状态转化为紧凑策略决策的流水线,包含四个主要步骤:
- 状态编码:处理可见手牌、行动历史、合法动作和游戏上下文。
- 结构化检索:使用预算限制的分解搜索,找出一组代表性候选动作,并总结其结构(长度、顺子、花色等)。
- 评分:共享编码器结合状态与候选特征,使执行者能够对候选动作排序,评估者能够估计状态价值。
- 自对弈学习:使用近端策略优化(PPO)与广义优势估计(GAE)从游戏轨迹中学习,提升 AI 偏好能带来长期成功的动作的能力。
适用人群
本项目适合对游戏 AI、强化学习,以及将 PPO 应用于大动作空间游戏的 AI 研究人员和开发者。
亮点
- 三代演进:代码库包含 V1(结构化检索)、V2(学习选择)和 V3(基于 PPO 的记忆感知策略学习)。
- 业界领先性能:在与基于规则和基于学习的官丹基线对比中,达到领先水平。
- 完整流水线:包含完整的官丹规则引擎、合法动作生成和训练基础设施。
- 硬件灵活性:支持 CPU、NVIDIA CUDA 和 Ascend NPU 加速,可选 C++ 内核以实现更快的检索。
相关
- 项目
- 项目
- 项目
- 项目