一类三维装箱问题的多智能体分层强化学习求解算法研究
初阳1
燕雪峰2
张玄烨3
徐云雯3
李德伟3
1.南京航空航天大学计算机科学与技术学院,江苏南京 211106;江苏自动化研究所,江苏连云港 2220612.南京航空航天大学计算机科学与技术学院,江苏南京 211106;中国南京软件新技术与产业化协同创新中心,江苏南京 2100233.上海交通大学自动化系,上海 200240
摘要:针对半在线场景下的多箱体三维装箱问题(3D-BPP),为了提高装箱决策效率和装箱空间利用率,本文提出一种多智能体分层强化学习算法.该算法采用多智能体马尔可夫决策过程(MAMDP)对问题进行建模,通过3个完全合作的智能体分别负责货物选择、箱子选择和摆放位置规划,并引入值分布学习方法以增强算法的稳定性和收敛性.实验结果表明,该算法在不同环境配置下均表现出良好的性能,空间利用率和装入货物数量显著提升,且在多箱体和多货物选择场景下展现出较强的泛化能力.与传统的启发式算法相比,该算法在动态决策和适应性方面具有明显优势,尤其在处理未知分布的货物尺寸时表现出较强的鲁棒性.该算法首次将多智能体分层强化学习框架应用于3D-BPP,实现装箱决策的端到端优化,为复杂装箱场景提供了一种新颖的解决方案.
关键词:三维装箱问题深度强化学习多智能体强化学习组合优化
论文发表日期:2025-12-30
在线出版日期:2026-03-05(本平台首次上网日期,不代表文献的发表时间)
页数:8( 2569-2576 )
英文信息展开
控制理论与应用

控制理论与应用

CSTPCD北大核心EICSCD
ISSN:1000-8152
年,卷(期):2025,42(12)
所属栏目:“智能决策与预测控制”专刊