动态环境中的分层强化学习
沈晶
程晓北
刘海波
顾国昌
张国印
1.哈尔滨工程大学,计算机科学与技术学院,黑龙江,哈尔滨,1500012.哈尔滨工程大学,计算机科学与技术学院,黑龙江,哈尔滨,1500013.哈尔滨工程大学,计算机科学与技术学院,黑龙江,哈尔滨,1500014.哈尔滨工程大学,计算机科学与技术学院,黑龙江,哈尔滨,1500015.哈尔滨工程大学,计算机科学与技术学院,黑龙江,哈尔滨,150001
摘要:现有的强化学习方法都不能很好地处理动态环境中的学习问题,当环境变化时需要重新学习最优策略,若环境变化的时间间隔小于策略收敛时间,学习算法则不能收敛.本文在Option分层强化学习方法的基础上提出一种适应动态环境的分层强化学习方法,该方法利用学习的分层特性,仅关注分层任务子目标状态及当前Option内部环境状态的变化,将策略更新过程限制在规模较小的局部空间或维数较低的高层空间上,从而加快学习速度.以二维动态栅格空间内两点间最短路径规划为背景进行了仿真实验,实验结果表明,该方法策略学习速度明显高于以往的方法,且学习算法收敛性对环境变化频率的依赖性有所降低.
关键词:分层强化学习动态环境Option策略更新
分类号:TP18(自动化基础理论)
资助基金:中国博士后科学基金(20060400809)哈尔滨工程大学校科研和教改项目(HEUFT07022;HEUFF05068;HEUFT05021)
论文发表日期:2008-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 71-74 )
英文信息
