DOI: 10.11799/ce202209019
基于均值偏差奖赏函数的放煤口控制策略研究
罗开成1
高阳2
杨艺3
常亚军1
袁瑞甫4
1.郑州煤矿机械集团股份有限公司,河南郑州 450016;郑州煤机液压电控有限公司,河南郑州 4500162.郑州煤机液压电控有限公司,河南郑州 450016;河南理工大学电气工程与自动化学院,河南焦作 4540003.郑州煤矿机械集团股份有限公司,河南郑州 450016;郑州煤机液压电控有限公司,河南郑州 450016;河南理工大学电气工程与自动化学院,河南焦作 4540004.煤炭安全生产与清洁高效利用省部共建协同创新中心,河南焦作 454000
摘要:根据液压支架的空间布局以及放煤口动作过程的特性,将放煤过程抽象为马尔科夫决策过程.同时,以强化学习为框架,在无需样本训练的情况下,利用Q-learning算法在线学习顶煤赋存状态与放煤口动作之间的映射关系,从而实现放煤口动作的最优决策.为保证放煤过程中煤岩分界面均匀下降,在Q-learning算法中设计了一种基于均值偏差的奖赏函数,并在Linux系统中建立了工作面连续进刀放煤三维仿真实验平台,对算法的有效性进行了验证.实验结果表明,基于均值偏差奖赏函数学习到的放煤口控制策略,能够保证在放顶煤过程中煤岩分界面更加均匀地下降.在工作面连续进刀放煤条件下,基于均值偏差奖赏函数Q-learning的智能放煤工艺,放煤平均奖励可达13467.8,比原Q-learning智能放煤工艺提高8.8%,比单轮顺序放煤等传统工艺提高约10%.
关键词:综合机械化开采放顶煤智能化强化学习
分类号:TD823.97(矿山开采)
资助基金:国家重点研发计划(2018YFC0604502)河南省煤矿智能开采技术创新中心支撑项目(2021YD01)河南省科技攻关项目(212102210390)
论文发表日期:2022-09-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 105-111 )
英文信息
