基于改进双延迟深度确定性策略梯度法的无人机反追击机动决策
郭万春1
解武杰1
尹晖2
董文瀚1
1.空军工程大学航空工程学院,西安,7100382.空军工程大学教研保障中心,西安,710051
摘要:针对近距空战下的自主机动反追击问题,建立了无人机反追击马尔科夫(Markov)决策过程模型;在此基础上,提出了一种采用深度强化学习的无人机反追击自主机动决策方法.新方法基于经验回放区重构,改进了双延迟深度确定性策略梯度(TD3)算法,通过拟合策略函数与状态动作值函数,生成最优策略网络.仿真实验表明,在随机初始位置/姿态条件下,与采用纯追踪法的无人机对抗,该方法训练的智能无人机胜率超过93%;与传统的TD3、深度确定性策略梯度(DDPG)算法相比,该方法收敛性更快、稳定性更高.
关键词:深度强化学习近距空战无人机双延迟深度确定性策略梯度法
分类号:V279(各类型航空器)
论文发表日期:2021-08-25
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 15-21 )
英文信息
