安全强化学习及其在机器人系统中的应用综述
张昌昕
张兴龙
徐昕
陆阳
国防科技大学智能科学学院,湖南长沙 410000
摘要:强化学习是一类通过与环境交互实现序贯优化决策的机器学习方法,已经在游戏、推荐系统及自然语言处理等任务中得到了应用.然而,强化学习算法应用于真实世界中的机器人系统时,如何保证安全性仍然面临挑战.近年来,针对机器人系统的安全强化学习方法研究已经成为热点方向,获得了机器人和强化学习领域的广泛关注.本文结合现有的工作,综述了安全强化学习理论和方法的重要成果和发展趋势,并重点关注了现有方法在机器人领域的适用性.本文首先给出了安全强化学习的一般问题描述.其次,从方法和性能的角度重点介绍了该领域的最新重要进展,包括约束策略优化、控制障碍函数、安全过滤器和对抗性博弈训练等方法,以及安全强化学习方法在地面移动机器人系统、无人飞行器和其他机器人系统中的应用情况.最后,对该领域的未来研究方向进行了展望和探讨.
关键词:机器人安全强化学习约束马尔可夫决策过程鲁棒性
论文发表日期:2023-12-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:14( 2090-2103 )
英文信息
