平均报酬模型的多步强化学习算法
胡光华
吴沧浦
1.北京理工大学自动控制系,北京,1000812.北京理工大学自动控制系,北京,100081
摘要:讨论模型未知的平均报酬强化学习算法.通过结合即时差分学习与R学习算法,将折扣问题中的一些方法推广到了平均准则问题中,提出了两类算法:R(λ)学习与截断即时差分TTD(λ)学习.现有的R学习可视为R(λ)学习和TTD(λ)学习当λ=0时的一个特例.仿真结果表明,λ取中间值的R(λ)和TTD(λ)学习比现有的方法在可靠性与收敛速度上均有提高.
关键词:强化学习即时差分学习马氏决策过程R学习
分类号:O231(控制论、信息论(数学理论))
资助基金:中国科学院项目(非规范项目)(69674005)
论文发表日期:2000-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 660-664 )
英文信息展开
控制理论与应用

控制理论与应用

北大核心CSTPCDEI
ISSN:1000-8152
年,卷(期):2000,17(5)
所属栏目:论文与报告