基于端到端深度强化学习的多订单动态柔性作业车间调度方法
王旭1
李寰1
韩玉艳1
王玉亭1
王雅坤2
1.聊城大学 计算机学院,山东 聊城 2520592.山东省大数据中心,山东 济南 250100
摘要:针对多订单随机到达条件下的动态柔性作业车间调度问题(Dynamic Flexible Job Shop Scheduling Problem with Order Random Arrival,DFJSP_ORA),提出一种面向实际生产环境的建模与求解框架.首先构建了以最小化最大完工时间为优化目标DFJSP_ORA的数学模型.引入流体模型对系统行为进行连续近似,从而提取关键状态特征.调度过程被建模为马尔可夫决策过程(Markov Decision Process,MDP),并采用近端策略优化(Proximal Policy Optimization,PPO)算法构建端到端的深度强化学习框架进行求解.该方法结合复合规则驱动的离散动作空间与优势函数驱动的策略优化机制,实现了对动态环境的高效决策.最后通过81个不同规模的实例,对所提方法与6种优先调度规则及3种强化学习方法进行比较,结果验证了其优越性,为DFJSP_ORA的求解提供了一种高效、灵活的解决方案.
关键词:柔性作业车间调度深度强化学习近端策略优化流体模型最大完工时间
分类号:TH165(机械制造工艺)TP18(自动化基础理论)
资助基金:国家自然科学基金(61973203)国家自然科学基金(61803192)国家自然科学基金(62106073)国家自然科学基金(61966012)山东省自然科学基金(ZR2023MF022)聊城大学光岳青年创新团队(LCUGYTD2022-03)生数据库架构创新及高性能核心技术资助(ZTZB-23-990-024)
论文发表日期:2026-04-25
在线出版日期:2026-08-28(本平台首次上网日期,不代表文献的发表时间)
页数:14( 192-204,273 )
英文信息展开
聊城大学学报(自然科学版)

聊城大学学报(自然科学版)

ISSN:1672-6634
年,卷(期):2026,39(2)
所属栏目:智能控制理论与应用