深度强化学习算法求解动态流水车间实时调度问题
杨媛媛1
胡蓉1
钱斌1
张长胜2
金怀平2
1.昆明理工大学信息工程与自动化学院,云南昆明 650500;昆明理工大学云南省人工智能重点实验室,云南昆明 6505002.昆明理工大学信息工程与自动化学院,云南昆明 650500
摘要:本文针对动态流水车间调度问题(DFSP),以最小化最大完工时间为优化目标,提出一种自适应深度强化学习算法(ADRLA)进行求解.首先,将DFSP的新工件动态到达过程模拟为泊松过程,进而采用马尔科夫决策过程(MDP)对DFSP的求解过程进行描述,将DFSP转化为可由强化学习求解的序贯决策问题.然后,根据DFSP的排序模型特点,设计具有较好状态特征区分度和泛化性的状态特征向量,并依此提出5种特定动作(即调度规则)来选择当前需加工的工件,同时构造基于问题特性的奖励函数以获取动作执行效果的评价值(即奖励值),从而确定ADRLA的3类基本要素.进而,以深度双Q网络(DDQN)作为ADRLA中的智能体,用于进行调度决策.该智能体采用由少量小规模DFSP确定的数据集(即3类基本要素在不同问题上的数据)训练后,可较准确刻画不同规模DFSP的状态特征向量与Q值向量(由各动作的Q值组成)间的非线性关系,从而能对各种规模DFSP进行自适应实时调度.最后,通过在不同测试问题上的仿真实验和与算法比较,验证了所提ADRLA求解DFSP的有效性和实时性.
关键词:流水车间调度新工件到达深度强化学习动态实时调度智能调度
论文发表日期:2024-06-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:9( 1047-1055 )
英文信息展开
控制理论与应用

控制理论与应用

CSTPCD北大核心EICSCD
ISSN:1000-8152
年,卷(期):2024,41(6)
所属栏目:"数据与模型融合的智能调度优化"专刊