多智能体专家型策略梯度的目标跟踪与清障
孙辉辉1
胡春鹤2
张军国2
1.北京林业大学工学院,北京100083;华北科技学院机电工程学院,河北廊坊0652012.北京林业大学工学院,北京100083
摘要:为适应复杂环境下目标跟踪机器人高效运动规划需求,本文提出一种基于多智能体强化学习的专家型策略梯度(ML-DDPG)方法.为此首先构建了基于最小化任务单元的分布式多Actor-Critic网络架构;随后针对机器人主动障碍清除和目标跟踪任务建立了强化学习运动学模型和视觉样本预处理机制,由此提出一种专家型策略引导的最优目标价值估计方法;进一步通过并行化训练与集中式经验共享,提升了算法的训练效率;最后在不同任务环境下测试了ML-DDPG算法的目标跟踪与清障性能表现,和其它算法对比验证了其在陌生环境中良好的迁移与泛化能力.
关键词:移动机器人多智能体强化学习运动规划专家策略
资助基金:国家自然科学基金(61703047)河北省高等学校科学技术研究项目(QN2021312)
论文发表日期:2022-10-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:11( 1854-1864 )
英文信息展开
控制理论与应用

控制理论与应用

EICSTPCD北大核心
ISSN:1000-8152
年,卷(期):2022,39(10)
所属栏目:“复杂CPS的分布式优化及其应用”专刊