可数状态空间的平均成本马氏决策过程
张俊玉1
吴怡婷1
夏俐2
曹希仁3
1.中山大学数学学院,广东广州5102752.中山大学管理学院,广东广州5102753.香港科技大学电子与计算机工程系,中国香港
摘要:具有可数状态空间的马尔可夫决策过程(Markov decision process,MDP)在平均准则下,最优(平稳)策略不一定存在.本文研究平均准则可数状态MDP中满足最优不等式的最优策略.不同于消去折扣(因子)方法,利用离散的Dynkin公式推导本文的主要结果.首先给出遍历马氏链的泊松方程和两个零常返马氏链的例子,证明了满足两个方向相反的最优不等式的最优策略存在性.其次,通过两个比较引理和性能差分公式,证明了正常返链和多链最优策略的存在性,并进一步推广到其他情形.特别地,本文通过几个应用举例,说明平均准则性能敏感的本质.本文的结果完善了可数状态MDP在平均准则下的最优不等式的理论.
关键词:马尔可夫决策过程平均准则可数状态空间Dynkin公式泊松方程性能敏感
论文发表日期:2021-11-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:10( 1707-1716 )
英文信息展开
控制理论与应用

控制理论与应用

EICSTPCD北大核心
ISSN:1000-8152
年,卷(期):2021,38(11)