基于对手池的两人格斗游戏深度强化学习
梁荣钦
朱圆恒
赵冬斌
中国科学院大学,人工智能学院,北京 100049;中国科学院自动化研究所,多模态人工智能系统全国重点实验室,北京 100190
摘要:双人游戏在游戏人工智能领域是一个基本且重要的问题,其中一对一零和格斗游戏是最为典型的双人游戏之一.本文基于深度强化学习对格斗游戏博弈对抗策略进行研究.首先建模格斗游戏环境,设计可用于格斗游戏决策的状态、动作以及奖赏函数,并将阶段策略梯度算法应用于对抗策略的学习.为了尽可能学到纳什均衡策略实现战胜任意对手的目标,本文设计了基于历年参赛的智能体构造对手池用于智能体训练,并探索对手选择机制对于训练过程的影响.最后在固定对手池的基础上,设计了自增长对手池算法,以提升对手策略的完备性和训练智能体的鲁棒性.为了提高环境采样速度,本文从传统并行框架出发,设计了可用于双人游戏的多服务器分布式并行采样框架.通过实验对比发现,基于自增长对手池方法所学的智能体能以96.6%的胜率击败固定对手池中的智能体,并且在与3个仅用于测试的智能体对战时,也表现出了 72.2%的胜率.
关键词:实时格斗游戏深度强化学习两人零和博弈对手策略池
论文发表日期:2025-02-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:9( 226-234 )
英文信息
