基于自生成专家样本的探索增强算法
刘健
赵恒一
中国矿业大学信息与控制工程学院,江苏徐州221116
摘要:为进一步提高深度强化学习算法在连续动作环境中的探索能力,以获得更高水平的奖励值,本文提出了基于自生成专家样本的探索增强算法.首先,为满足自生成专家样本机制以及在连续动作环境中的学习,在双延迟深度确定性策略梯度算法的基础上,设置了两个经验回放池结构,搭建了确定性策略算法的总体框架.同时提出复合策略更新方法,在情节的内部循环中加入一种类同策略学习过程,智能体在这个过程中完成对于参数空间的启发式探索.然后,提出基于自生成专家样本的演示机制,由智能体自身筛选产生专家样本,并根据参数的更新不断调整,进而形成动态的筛选标准,之后智能体将模仿这些专家样本进行学习.在OpenAI Gym的8组虚拟环境中的仿真实验表明,本文提出的算法能够有效提升深度强化学习的探索能力.
关键词:深度强化学习探索专家样本确定性策略
资助基金:国家自然科学基金(61906198)江苏省自然科学基金(BK20190622)
论文发表日期:2023-03-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 485-492 )
英文信息
