基于深度强化学习的水下无人航行器高速目标捕获路径规划
庞舟岐1
郝程鹏2
林晓波2
潘光帅2
1.中国科学院声学研究所,北京 100190;中国科学院大学,北京 1000492.中国科学院声学研究所,北京 100190
摘要:高速水下目标捕获问题存在诸多挑战,一方面,受水下多变的环境影响,声呐探测数据有较大的时延性和不确定性;另一方面,由于目标速度快,拦截器无法以追击姿态进行捕获,使得可拦截轨迹的数量大大减少.基于此,本文提出了一种改进的双延时深度确定性策略梯度(ITD3)算法来提高拦截器的捕获效率和精度.首先,基于拦截器动力学本文构建"规划器-控制器"级联仿真方式,相较于纯运动学仿真更精确,相较于制导控制一体模型更符合实际情况;其次,为了解决动作空间较大以及水下传感器存在时延的问题,本文提出了动作掩膜机制并引入了基于时延的探索噪声;再次,为使奖励函数契合高速目标捕获任务特点,本文设计了新的奖励函数对不利于捕获的状态进行惩罚;最后,为提高算法的收敛速度和稳定性,本文在TD3算法的基础上融合优先级经验回放以及softmax操作符.仿真实验和半实物仿真表明,和传统捕获算法相比,本文提出的ITD3算法捕获目标的时间更短、脱靶率更低,并有着较强的可行性.
关键词:深度强化学习确定性策略梯度高速目标捕获水下无人航行器马尔可夫决策过程
论文发表日期:2025-10-30
在线出版日期:2025-11-13(本平台首次上网日期,不代表文献的发表时间)
页数:13( 1968-1980 )
英文信息展开
控制理论与应用

控制理论与应用

CSTPCD北大核心EICSCD
ISSN:1000-8152
年,卷(期):2025,42(10)
所属栏目:论文与报告