基于门控循环神经网络的时间序列多智能体对手建模方法
胡智尧
于淼
田开元
军事科学院战争研究院,北京,100091
摘要:大量研究表明多智能体强化学习算法在智能体数量变多时难以收敛,但若在获得对手行动信息的前提下进行集中式训练,可克服非平稳环境等挑战,实现更好的学习效果.针对对手连续决策的预测问题,提出了基于门控循环神经网络的时间序列对手建模方法,将对手状态、环境状态、我方智能体行动等数据构建时间序列,利用门控循环单元挖掘对手行动规律,从而捕捉对手智能体连续决策的时序信息;设计了可变长度推理方法,通过评估上述时间序列的可信度,确定模型输入的最佳时间序列长度,避免误用对手陈旧样本数据.实验结果表明,该模型结合可变长度推理方法能实现更强的对手预测能力,可有效从历史时间序列中学习对手智能体如何适应不断变化的环境并预测对手未来行动.与SAM等现有方法相比,本文所提方法通过评估对手行动的预测可信度来筛选最佳历史序列,在对手行动预测准确率上提升了6%以上.
关键词:深度强化学习多智能体门控循环单元时间序列预测对手建模
分类号:TP391.4(计算技术、计算机技术)
资助基金:国家自然科学基金(62402519)
论文发表日期:2025-12-25
在线出版日期:2025-12-26(本平台首次上网日期,不代表文献的发表时间)
页数:10( 106-115 )
英文信息展开
空军工程大学学报

空军工程大学学报

CSTPCD北大核心CSCD
ISSN:2097-1915
年,卷(期):2025,26(6)
所属栏目:军事智能