连续时间部分可观Markov决策过程的策略梯度估计
唐波
李衍杰
殷保群
1.中国科学技术大学,自动化系,安徽,合肥,2300272.中国科学技术大学,自动化系,安徽,合肥,2300273.中国科学技术大学,自动化系,安徽,合肥,230027
摘要:针对连续时间部分可观Markov决策过程(CTPOMDP)的优化问题,本文提出一种策略梯度估计方法.运用一致化方法,将离散时间部分可观Markov决策过程(DTPOMDP)的梯度估计算法推广到连续时间模型,研究了算法的收敛性和误差估计问题,并用一个数值例子来说明该算法的应用.
关键词:连续时间部分可观Markov决策过程策略梯度估计一致化误差界
分类号:O232(控制论、信息论(数学理论))
资助基金:国家自然科学基金(60574065)国家高技术研究发展计划(863计划)(863;2006AA01Z114)种子基金(JL0606)
论文发表日期:2009-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 805-808 )
英文信息
