基于多智能体全局优化的液压支架成组调直方法
代亚鹏1
常亚军2
杨艺1
刘斌斌2
王科平1
1.河南理工大学 电气工程与自动化学院,河南 焦作 454003;河南理工大学 河南省煤矿装备智能检测与控制重点实验室,河南 焦作 4540032.郑州恒达智控科技股份有限公司,河南 郑州 450000
摘要:采煤工作面直线度对围岩稳定性和回采效率至关重要.为了解决回采过程中煤壁、顶底板动态变化造成的难以建立准确的液压支架群最优调直控制模型的问题,提出了以马尔可夫决策过程为基础的多智能体调直控制方法.在该方法中,将各液压支架智能体化,从而避免对控制模型的依赖;同时,建立了液压支架成组调直的多智能体决策模型,智能体之间相互协作,采用强化学习实现了成组调直的最优决策.针对液压支架调直时执行的拉架动作是连续数值的特点,将单智能体TD3(Twin Delayed Deep Deterministic Policy Gradient)算法扩展到液压支架多智能体调直过程中;为了加快多智能体条件下调直策略的收敛速度,在多智能体强化学习框架中的Actor-Critic网络结构中引入层归一化处理,层归一化将各层输入数据重新汇聚在统一的概率分布下来加快神经网络权重的收敛.针对液压支架成组调直中多智能体最优策略求解困难的问题,设计了一种全局动作优化模块对液压支架多智能体的决策结果进行全局优化.此外,根据采煤工作面的工程实际,基于Gym框架(OpenAI Gym)开发了液压支架成组调直智能决策仿真平台,并开展了基于不同算法的液压支架成组调直试验.试验结果表明,提出的算法在直线度的平均值和均方差方面明显优于其他算法,当"S弯"成组支架数量为 7 个时,所提算法的工作面直线度较MA-TD3(Multi-Agent Twin Delayed Deep Deterministic Policy Gradient)算法提升了 86%,标准差减少了 71%.
关键词:液压支架成组调直马尔可夫决策多智能体强化学习全局动作优化最优决策
分类号:TD823.97(矿山开采)
资助基金:河南省科技攻关资助项目(232102210040)
论文发表日期:2026-01-20
在线出版日期:2026-02-02(本平台首次上网日期,不代表文献的发表时间)
页数:11( 226-236 )
英文信息展开
煤矿安全

煤矿安全

CSTPCD北大核心
ISSN:1003-496X
年,卷(期):2026,57(1)
所属栏目:矿山机电与安全监测