基于深度强化学习与自学习的多无人机近距空战机动策略生成算法
孔维仁1
周德云1
赵艺阳1
杨婉莎2
1.西北工业大学电子信息学院,陕西西安7101292.悉尼大学计算机学院,悉尼2006
摘要:为解决多无人机近距空战机动决策问题,提出一种基于参数共享Q网络与虚拟自我对局的多无人机近距空战机动策略生成算法.首先,设计一种适用于不同无人机编队规模的混合马尔可夫博弈模型与多无人机机动决策策略生成强化学习框架一参数共享Q网络,并通过自编码器对状态空间进行压缩以提高策略学习效率.然后,使用虚拟自我对局方法使机动策略收敛至纳什均衡策略.最后对自编码器的参数选择、策略生成算法的训练过程与机动策略的合理性与迁移性进行了仿真实验.通过仿真结果表明,引入自编码器可以有效地提高策略学习效率,并且使用该算法生成的多无人机近距空战机动策略具有合理性与良好的迁移性.
关键词:空战决策多无人机协同强化学习虚拟自我对局
资助基金:国家自然科学基金(61603299)国家自然科学基金(61612385)中央高校基本科研业务费专项资金项目(3102019ZX016)
论文发表日期:2022-02-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:11( 352-362 )
英文信息
