集中训练分布执行下的多智能体强化学习综述
李岳珩1
谢广明2
1.北京大学先进制造与机器人学院,北京 1008712.北京大学先进制造与机器人学院,北京 100871;北京大学人工智能研究院,北京 100871
摘要:近年来,多智能体强化学习(MARL)因其在解决实际问题上的巨大潜力而逐渐成为研究的热点.在复杂的多智能体系统中,集中式训练与分布式执行(CTDE)框架被广泛应用.CTDE通过集中训练的方式缓解了多智能体强化学习中的非平稳性问题,但也因此带来了新的挑战,特别是在训练过程中需要处理所有智能体的信息,尤其是随着智能体数量增加而呈指数级增长的联合动作空间.本文对CTDE框架下的多智能体强化学习算法及其发展进行了选择性的回顾,重点探讨了两大类算法:值函数分解方法和策略梯度方法.本文总结了这些算法在处理联合动作空间复杂性、非平稳性问题以及估计误差方面的表现,并提出了一些新的视角和思路,旨在为该领域的研究人员提供更深入的理解和未来研究的指导.
关键词:多智能体强化学习集中式训练分布式执行值函数分解强化学习
论文发表日期:2025-11-30
在线出版日期:2025-12-29(本平台首次上网日期,不代表文献的发表时间)
页数:11( 2114-2124 )
英文信息展开
控制理论与应用

控制理论与应用

CSTPCD北大核心EICSCD
ISSN:1000-8152
年,卷(期):2025,42(11)
所属栏目:论文与报告