多步强化学习算法的收敛性分析
杨瑞
天津大学数学学院 天津 300072
摘要:在强化学习(Reinforcement Learning)算法理论中,最近有学者提出了一个新的估值算法Q(σ) ,这里σ是采样度(degree of sampling),这是一个介于全采样(full-sampling)和非采样(no-sampling)的新方法. Q(σ)统一了Sarsa和Expect?ed Sarsa等传统算法,但是Q(σ)的提出者只在实验上验证了算法的有效性.该文对Q(σ)的收敛性作了理论分析,证明了在一定条件下Q(σ)是收敛的.
关键词:强化学习值函数估计优化时间差分
分类号:TP301.6(计算技术、计算机技术)
论文发表日期:2019-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 1582-1585 )
英文信息
