基于分层强化学习的天车调度优化方法
苏章圣1
蒋胜龙2
彭功状3
梁越永4
1.重庆大学材料科学与工程学院,重庆 4000442.重庆大学自动化学院,重庆 400044;重庆大学信息物理社会可信服务计算教育部重点实验室,重庆 403.北京航空航天大学国际前沿交叉科学研究院,北京 1001914.上海宝信软件股份有限公司,上海 201203
摘要:天车是车间、仓库、港口等工业园区中关键的重型物料运载装置,其调度对运输效率及生产目标达成影响显著.针对带时间窗约束的天车调度问题(CSP-TW),建立了一种基于时空离散化的混合整数线性规划模型.基于模型特征,设计了一种分层强化学习(HRL)决策框架:上层决策网络将运输任务指派至适合天车;下层决策网络规划各天车运行路径执行具体运输.在学习过程中,引入了动作禁忌规则规避无效动作,引导上下层决策网络向优势策略空间探索.随后,采用了外部经验池和D3QN策略训练决策网络.基于某公司钢厂物流仿真平台进行测试:消融实验表明所引入的动作禁忌规则可提高HRL学习效率;训练比较表明HRL的收敛性优于端到端框架;对比实验表明HRL的求解效果优于多规则组合法、元启发式算法、端到端和DQN等多类方法,并符合秒级响应的应用需求.
关键词:天车调度分层强化学习任务指派路径规划动作禁忌
论文发表日期:2025-11-30
在线出版日期:2025-12-29(本平台首次上网日期,不代表文献的发表时间)
页数:13( 2261-2273 )
英文信息
