Q学习算法中网格离散化方法的收敛性分析
蒋国飞
高慧琪
吴沧浦
1.北京理工大学自动控制系,北京,1000812.北京理工大学自动控制系,北京,1000813.北京理工大学自动控制系,北京,100081
摘要:Q学习算法是Watkins[1]提出的求解信息不完全马尔可夫决策问题的一种强化学习方法.要用Q学习算法来求解有连续状态和决策空间的随机最优控制问题,则需要先离散化问题的状态和决策空间.在本文中,我们证明了在满足一定的Lipschitz连续性和有关集合为紧集的条件下,随着网格密度的增加,空间离散化后Q学习算法求得的最优解依概率1收敛于原连续问题的最优解.
关键词:Q学习动态规划马尔可夫决策问题连续状态和决策空间离散化
分类号:O1(数学)
资助基金:中国科学院项目(非规范项目)(69674005)
论文发表日期:1999-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 194-198 )
英文信息
