采用资格迹的神经网络学习控制算法
刘智斌1
曾晓勤2
徐彦3
禹继国1
1.曲阜师范大学信息科学与工程学院,山东日照,2768262.河海大学计算机与信息学院,江苏南京,2100983.南京农业大学信息科技学院,江苏南京,210095
摘要:强化学习是解决自适应问题的重要方法,被广泛地应用于连续状态下的学习控制,然而存在效率不高和收敛速度较慢的问题.在运用反向传播(back propagation,BP)神经网络基础上,结合资格迹方法提出一种算法,实现了强化学习过程的多步更新.解决了输出层的局部梯度向隐层节点的反向传播问题,从而实现了神经网络隐层权值的快速更新,并提供一个算法描述.提出了一种改进的残差法,在神经网络的训练过程中将各层权值进行线性优化加权,既获得了梯度下降法的学习速度又获得了残差梯度法的收敛性能,将其应用于神经网络隐层的权值更新,改善了值函数的收敛性能.通过一个倒立摆平衡系统仿真实验,对算法进行了验证和分析.结果显示,经过较短时间的学习,本方法能成功地控制倒立摆,显著提高了学习效率.
关键词:强化学习神经网络资格迹倒立摆梯度下降
分类号:TP301(计算技术、计算机技术)
论文发表日期:2015-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 887-894 )
英文信息
