强化学习理论、算法及应用
张汝波
顾国昌
刘照德
王醒策
1.哈尔滨工程大学计算机系,哈尔滨,1500012.哈尔滨工程大学计算机系,哈尔滨,1500013.哈尔滨工程大学计算机系,哈尔滨,1500014.哈尔滨工程大学计算机系,哈尔滨,150001
摘要:强化学习(reinforcement learning)一词来自于行为心理学,这一理论把行为学习看成是反复试验的过程,从而把环境状态映射成相应的动作.首先全面地介绍了强化学习理论的主要算法,即瞬时差分法、Q -学习算法及自适应启发评价算法;然后介绍了强化学习的应用情况;最后讨论了强化学习目前所要研究的问题.
关键词:强化学习瞬时差分法Q-学习自适应启发评价智能控制系统
分类号:O231(控制论、信息论(数学理论))
论文发表日期:2000-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 637-642 )
英文信息
