基于模型的层次化强化学习算法
郑宇
罗四维
吕子昂
1.北京交通大学,计算机与信息技术学院,北京,1000442.北京交通大学,计算机与信息技术学院,北京,1000443.北京交通大学,计算机与信息技术学院,北京,100044
摘要:针对强化学习算法的状态值泛化和随机探索策略在确定性MDP系统控制中存在着学习效率低的问题,本文提出基于模型的层次化强化学习算法.该算法采用两层结构,底层利用系统模型,采用贪婪策略选择探索动作,完成强化学习任务.而高层通过对状态区域的分析,指导底层的学习,纠正底层错误的动作.高层对底层的学习的指导作用主要包括:在泛化过程中,对泛化区域中正确与错误的状态判断值分别采用不同的学习因子,减小泛化对算法收敛性的影响;建立状态区域的推理规则,用规则指导未知状态区域的学习,加快学习速度;利用系统模型和推理规则,将探索过程集中于系统的可控区域,克服采用随机探索策略需要系统全状态空间内搜索的问题.本文提出的算法能在较短的时间内实现系统的初步控制,其有效性在二级倒立摆的控制中得到验证.
关键词:强化学习马尔科夫决策过程探索策略倒立摆
分类号:TP18(自动化基础理论)
资助基金:国家自然科学基金(60373029)
论文发表日期:2006-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 1-5 )
英文信息
