基于DQN出价策略的多无人机目标分配拍卖算法
陈梓豪
胡春鹤
北京林业大学 工学院,北京 100083
摘要:为实现多无人机监测目标分配任务匹配度、成功率等收益最大化及路径长度、障碍物碰撞风险等代价最小化,基于数据样本驱动的强化学习方法,提出了一种融合深度Q网络(Deep Q-network,DQN)出价策略的自主进化拍卖算法.首先,构建了多无人机任务目标拍卖的马尔科夫决策模型,并且分别以竞拍者剩余竞拍容量为环境,输出增价因子为动作,前后两轮拍卖收益增幅为回报.其次,构建了新型的DQN出价和竞拍决策神经网络模型.该模型通过构建包含拍卖环境、增价因子、回报等元素的强化学习训练样本库,在拍卖过程中以一种离线学习模式不断训练DQN神经网络,使其按照DQN策略在拍卖过程中,根据拍卖环境输出增价因子,实现拍卖结果收益的优化.最后,通过多无人机多监测目标分配仿真,验证了所提出基于DQN拍卖机制的目标分配方法的有效性.通过与传统拍卖算法结果相比,方法获得的拍卖收益提升21.4%.
关键词:多无人机拍卖算法DQN多目标分配拍卖收益
分类号:TP181(自动化基础理论)
资助基金:国家自然科学基金(61703047)
论文发表日期:2024-08-28
在线出版日期:2026-08-28(本平台首次上网日期,不代表文献的发表时间)
页数:10( 23-32 )
英文信息
