基于角度特征的分布式DDPG无人机追击决策
王昱
任田君
范子琳
孟光磊
沈阳航空航天大学自动化学院,辽宁沈阳 110136
摘要:无人机执行追击任务过程中态势变化迅速,不灵活的网络更新机制和固化的奖励函数使得现有决策模型难以持续输出正确且高效的策略.针对此问题,提出了一种基于角度特征的分布式深度确定性策略梯度(DDPG)算法.首先,为避免梯度消失或爆炸以稳定模型训练过程,提出先利用梯度上升计算目标值,再使用MSE损失函数训练的Actor网络更新机制;然后,依据双方角度特征划分策略引导区域,通过设置不同的奖励函数权重,构建基于5个DDPG网络的分布式决策模型,利用在不同态势下对奖励函数权重的动态选择和无缝切换提升算法的决策能力.仿真实验表明,相比于DDPG和双延迟深度确定性策略梯度(TD3)算法,所提算法无论追击直线逃逸目标或智能逃逸目标,均具有更高的成功率和决策效率.
关键词:追击决策强化学习分布式DDPG算法角度特征
论文发表日期:2025-07-30
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:11( 1356-1366 )
英文信息
