随机平稳策略下半Markov决策过程的仿真优化算法
代桂平1
唐昊2
奚宏生3
1.北京工业大学,电子信息与控制学院,北京,100022;中国科学技术大学,自动化系,安徽,合肥,2300272.合肥工业大学,计算机系,安徽,合肥,2300093.中国科学技术大学,自动化系,安徽,合肥,230027
摘要:基于性能势理论和等价Markov过程方法,研究了一类半Markov决策过程(SMDP)在参数化随机平稳策略下的仿真优化算法,并简要分析了算法的收敛性.通过SMDP的等价Markov过程,定义了一个一致化Markov链,然后根据该一致化Markov链的单个样本轨道来估计SMDP的平均代价性能指标关于策略参数的梯度,以寻找最优(或次优)策略.文中给出的算法是利用神经元网络来逼近参数化随机平稳策略,以节省计算机内存,避免了"维数灾"问题,适合于解决大状态空间系统的性能优化问题.最后给出了一个仿真实例来说明算法的应用.
关键词:随机平稳策略等价Markov过程一致化Markov链神经元动态规划仿真优化
分类号:TP202(自动化技术及设备)
资助基金:国家自然科学基金(60274012)教学改革项目(00194)
论文发表日期:2006-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 547-551 )
英文信息展开
控制理论与应用

控制理论与应用

北大核心CSTPCDEI
ISSN:1000-8152
年,卷(期):2006,23(4)
所属栏目:论文