基于改进DDPG的无人船避障路径规划
吴一凡
李震
王楠
江苏科技大学海洋学院 镇江 212003
摘要:针对深度强化学习存在的在动态环境中训练时间长,收敛较慢,且某些复杂情况下效果不佳的情况,将多步自举N-step Bootstrap、扰动流体算法(IFDS)和深度确定性策略梯度算法(DDPG)结合起来.首先在DDPG添加N-step Boot-strap,赋予模型结合未来多个时间步的能力;其次引入扰动流体算法,与环境中障碍物的速度信息共同构建势场,解决高维连续动作空间问题并提高训练效率;最后搭建了单个运动障碍物和多个运动障碍物的环境来对算法进行了仿真验证.仿真结果表明改进DDPG算法在仿真环境中相较于传统DDPG算法有更高的训练稳定性和训练速度,能够成功实现较为复杂环境的动态避障,同时训练的成功率有所提高.
关键词:深度确定性策略梯度算法多步自举扰动流体算法路径规划无人船
分类号:TP273(自动化技术及设备)
论文发表日期:2025-12-20
在线出版日期:2026-03-23(本平台首次上网日期,不代表文献的发表时间)
页数:5( 36-40 )
英文信息
