具有记忆事件触发机制隐私保护的多智能体系统安全控制摘要:针对具有未知扰动的非线性多智能体系统,本文提出一种基于记忆事件触发机制并具有隐私保护的合作学习控制算法.首先,为防止智能体间交互的关键状态与控制信息泄露,构造时间掩码函数对整个系统进行隐私保护,提高加密能力同时减轻对系统性能的影响;其次,将记忆事件触发机制嵌入反步法控制框架,借助该机制对历史数据的存储能力实现安全控制目标;同时,利用历史数据设置阈值条件,避免虚假信号影响通讯并保证系统的瞬态性能;最后,提出基于误差的合作学习自适应律.其不需要预先假定邻居权重是有限的,从而减少了保守性,通过理论分析和仿真结果验证所构建事件触发控制方案的可行性.
多智能体系统事件触发机制隐私保护安全控制
欠驱动系统自适应事件触发约束跟随控制摘要:欠驱动系统因其独特的性能优势被广泛研究和应用,但其复杂的动力学特性会导致控制上的困难.约束跟随控制方法可以有效解决欠驱动系统的控制问题.为降低通信成本,提升控制性能,针对该方法提出了一种新型的事件触发机制.首先,将系统期望轨迹设计为伺服约束,并利用约束跟随控制理论导出伺服控制输入的解析解;其次,引入含自适应增益的事件触发机制:通过比较状态偏差补偿控制输入与实时/目标控制输入的偏差,确定允许控制信号更新的时间,再通过自适应增益选择合适的时间点触发控制信号更新.该机制通过自适应增益动态调整更新频率,以优化通信效率.通过Lyapunov方法分析了该控制策略的稳定性,并证明了能够有效避免Zeno现象;最后,通过欠驱动平面垂直起降飞行器上的仿真实验,验证了所提方法的有效性.结果表明,该事件触发机制不仅实现了通信负载和系统性能之间的平衡,还表现出对干扰的强适应性.
欠驱动系统约束跟随控制事件触发机制镇定自适应算法
抑制一管多机水力耦合影响的协同镇定控制策略摘要:针对一管多机系统中水力耦合下多机协同控制不足的问题,本文提出一种基于协同控制理论的多机协同镇定控制策略,用于建立多机联系.首先,重新考虑共用管道的动态水头耦合变化项,构建包含多台机组状态变量的宏变量,以多机主要状态变量的输出偏差为控制核心来预设平衡点.然后,将宏变量代入控制流形,推导出新形式的耦合水头项,将原有线性模型转化为非线性模型来跟踪机组变化.通过与原形式输出状态对比验证了所提策略在降低机组输出振荡、增强系统孤网运行稳定方面表现优异,为水力耦合的处理提供了可行的解决方案.
一管多机系统水力耦合镇定控制协同控制器状态反馈
需求响应下基于深度强化学习的综合能源系统能量管理策略摘要:含光伏、储能及燃气轮机等分布式能源的综合能源系统(IES)具有多能协调、互补共济的能源利用形式,能够在参与电网需求响应时发挥重要作用.针对IES如何有效响应电网调峰需求的问题,文中将多能耦合转化与内部用户负荷响应作为IES的能量管理手段,提出了考虑多能互补与内部用户响应特性的IES日内调度优化方法.首先,在IES多能耦合运行架构的基础上分析了内部用户的响应特性,分别通过补贴价格与负荷削减量来改变内部用户的电负荷需求,进而,构建了光伏出力与负荷不确定下IES参与电网需求响应的能量管理策略优化模型;然后,运用基于TD3的深度强化学习算法实现了IES能量管理策略的求解;最后,通过算例表明,所提能量管理策略优化模型与策略优化方法能够合理制订系统内部的能量转换控制和需求响应方案以充分挖掘系统的响应潜力,从而,有效完成电网的调峰需求响应目标.
综合能源系统多能互补需求响应调度优化深度强化学习
基于离散时间神经网络方法的高超声速飞行器跟踪控制摘要:高超声速飞行器是一个具有强非线性、强耦合等特性的多输入多输出系统.此外,当升降舵作为唯一控制舵面时,系统模型中的升降舵-升力耦合项会导致高超声速飞行器系统呈现非最小相位特性,因此其跟踪控制问题具有一定的挑战性.本文基于离散时间输出调节理论,研究了升降舵作为唯一控制舵面条件下高超声速飞行器的跟踪控制问题.首先将高超声速飞行器的跟踪控制问题描述为近似离散时间输出调节问题.由于高超声速飞行器对应的离散调节器方程的精确解不可得,本文通过神经网络方法来获取离散调节器方程的近似解,进而设计一个离散时间神经网络控制器来实现高超声速飞行器的跟踪控制.仿真结果表明,本文所提出的控制算法具有良好的跟踪性能.
离散时间非线性系统高超声速飞行器跟踪控制输出调节神经网络
高阶交互下具有环星型结构的分数阶时滞神经网络分岔摘要:目前国内外关于神经网络分岔动力学研究主要集中于神经元间的二元交互,而神经网络中普遍存在神经元间以群和组的形式发生的高阶交互作用.但是如今关于高阶交互作用对神经网络动力学的影响研究还不深入.研究具有高阶交互作用的神经网络可以进一步探索真实神经网络中的高阶属性和动力学演化规律.为此,本文提出了一类高阶交互下具有环星型结构的分数阶时滞神经网络模型.选取时滞作为分岔参数,给出系统的稳定性和Hopf分岔的充分条件,揭示高阶耦合系数、自反馈系数和分数阶次对系统动力学的影响机制.
神经网络高阶交互作用分数阶Hopf分岔
FDI攻击下的ICPS状态重构安全控制策略摘要:为提高同时遭受执行器通道和传感器通道虚假数据注入(FDI)攻击的工业信息物理系统(ICPS)的安全性,本文研究重构FDI攻击信号和ICPS状态的安全控制策略.首先,构建由系统状态和传感器攻击信号组成的增广状态,并根据该增广状态来建立增广系统;其次,在建立的增广系统基础上,设计可调比例积分观测器,用于重构系统状态、传感器FDI攻击信号和执行器FDI攻击信号;然后,通过重构的系统状态和执行器FDI攻击信号设计反馈控制器,并采用李雅普诺夫函数和有限频域H∞来分析系统满足稳定性和鲁棒性所需的条件;最后,使用垂直起降飞机的线性纵向动力学模型作为仿真对象,模拟结果验证本文所研究的控制策略可以抵御针对ICPS的FDI攻击并且保证系统稳定.
工业信息物理系统虚假数据注入攻击观测器状态重构安全控制有限频域鲁棒性
基于变车距策略的混合车辆队列协同控制摘要:车辆队列协同控制研究中采用的间距策略是车辆队列系统保持内稳定性与队列稳定性的关键因素之一.现有混合车辆队列控制研究大多采用固定间距策略,难以应用于复杂的道路行驶环境.为此,研究了基于变车距策略的混合车辆队列协同控制方法,以及混合车辆队列的稳定性问题.首先,针对由人工驾驶车辆(HDV)和网联自动驾驶车辆(CAV)构成的混合车辆队列,设计了二次型变车距策略,构建了基于该变车距策略的混合车辆队列系统模型;其次,提出了基于多智能体一致性的混合车辆队列协同控制器,迭代推导出适用于包含多辆CAV的双向多车领航车跟随式拓扑的混合车辆队列首尾传递函数;最后,设计数值仿真实验,验证了所提控制器的有效性,并讨论了驾驶员反应时延与车辆通信时延、CAV数量、拓扑结构、CAV位置以及控制增益对混合车辆队列稳定性的影响.
交通工程混合车辆队列变车距策略协同控制稳定性
重置事件触发机制下多智能体系统二分一致性摘要:本文研究了细节平衡通信拓扑图下的一阶多智能体系统的二分一致性问题.不同于文献中常见的动态事件触发方法,提出一种与重置机制相结合的新型动态事件触发控制策略,触发条件阈值中的外部动态变量可以根据预设的重置条件进行调节,当局部不一致状态偏差达到预设重置条件时,动态变量将被重置为其初始值,由此避免系统临近一致点时的频繁触发现象,在保证期望控制性能的同时,进一步降低系统的通信负担.文章提出的重置事件触发条件仅依赖智能体的局部状态构成,无需全局信息.随后,本文应用代数图论和李雅普诺夫稳定性理论,证明了系统的实用二分一致性.此外,给出了无芝诺行为的理论分析.最后,通过仿真验证了提出方法的有效性.
多智能体系统重置事件触发控制二分一致性细节平衡图李雅普诺夫方法
面向分布式同构混合流水车间绿色调度的多目标优化方法摘要:在双碳目标的背景下,制造业的发展既面临挑战又面临机遇,为响应国家政策,大力减少碳排放量,本文以分布式混合流水车间绿色调度问题作为研究对象,对于具有相同加工能力的工厂车间,本文构建了一个分布式同构混合流水车间绿色调度问题模型,结合实际工厂特点,给出加工期间碳排放量的计算公式.结合问题特性提出了改进的NSGA-Ⅱ算法,设计了算法的混合初始化策略、更新策略和降碳策略以提高算法的性能,在算法的实验验证中,设计消融实验验证了所提策略的有效性,并与多种先进的多目标优化算法进行对比实验,验证了改进算法在求解该问题上的有效性.
分布式混合流水车间调度双碳目标多目标优化NSGA-Ⅱ
被引:2
融合深度强化学习与图神经网络的动态武器目标分配优化摘要:本文提出了一种基于深度强化学习(DRL)与图神经网络(GNN)的动态传感器武器目标分配(SWTA)方法,旨在应对现代战场中复杂和动态的决策需求.传统静态方法在实时变化的战场中效率低、适应性差.为此,本文通过结合深度强化学习与图神经网络,构建智能决策框架,利用环境交互和深度学习优化决策策略,提高资源分配效率和决策精度.框架受OODA环理论指导,通过图神经网络捕捉场景中武器、目标和传感器的关系特征,快速生成分配方案,结合深度强化学习优化策略,实现动态环境下的资源分配优化.优化过程中考虑到了作战效能,资源消耗和关键要地保护的约束.实验表明,该方法在多种场景中表现优异,显著提升了资源利用率和作战效果.
动态传感器武器目标分配深度强化学习图神经网络OODA环
被引:1
网络化系统的学习与控制摘要:网络化系统是指由多个具有交互和任务执行能力的子系统基于网络结构连接而成的动态系统.由于在不同应用场景中经常呈现高维、多约束、非凸、非线性等特点,网络化系统的分析与控制问题在本世纪受到了来自不同领域的广泛关注.为应对动态环境与复杂系统中的不确定性等问题,具有端到端特性的强化学习方法被引入到网络化系统的控制策略学习中.然而,网络化系统的高维数与结构化特性使强化学习的效率和有效性面临严峻挑战.事实上,许多研究发现,网络化系统的性能与其网络结构密切相关,从图的角度切入能够把复杂的控制问题转化为简单的组合优化问题,进而实现对实际大规模网络的应用.鉴于此,本文从图的视角出发,对基于学习的网络化系统控制方法做系统性梳理,通过考察线性二次调节与马尔可夫博弈两种模型下的最优控制问题,揭示图结构在网络化系统控制策略学习中的重要作用,同时也将列举该领域现存的难题并展望未来的发展方向.
网络化系统强化学习数据驱动控制分布式控制
中大飞板:一种高速单杆无人水翼船摘要:针对目前自主水中载具存在的运行速度慢,工作范围有限问题,本文设计了一款新型高速单杆无人水翼船:中大飞板.与传统自主水中载具不同,中大飞板具有3种运动模式,使其可以适用于不同的海洋任务.本文针对中大飞板的水翼模式展开深入研究.中大飞板的水翼模式借鉴了固定翼无人机的设计理念,将水翼作为机体的重要组成部分.当水翼在水中运动时,会产生向上的升力,这一升力能够把船体抬离水面,减少船体与水的接触面积,进而降低船体前进时所受到的阻力.由于阻力大幅降低,中大飞板得以实现更快的前进速度,更低的能量消耗以及更广阔的工作范围.同时,依据伯努利原理,水翼的升力与速度的平方成正比,因此中大飞板更快的前进速度使中大飞板具备更强的负载能力.本文详细地介绍了中大飞板的工作原理,设计过程以及控制方法,并通过实验验证了设计方法的有效性,以及中大飞板相较于传统单体船和双体船的优越性能.中大飞板的更多详情可以通过以下链接查看:
中大飞板无人水面船水翼船
代理模型和Kalman滤波偏差估计增强的个性化差分进化算法摘要:基于用户交互的进化优化算法可有效提高个性化推荐的性能,但已有研究忽略了编码个体与解码样本间的偏差,往往导致算法搜索方向出现较大偏离,搜索效率低;此外,用户交互评价的定量化表示也是较大挑战.针对此,本文提出了融合Kalman滤波偏差估计和代理模型的个性化差分进化算法.首先,构建了基于用户评价、商品属性等的深度信念网络代理模型,实现对用户交互的定量评价;然后,设计Kalman滤波偏差估计器,跟踪进化过程中基因型和表现型之间的偏差,并基于该偏差设计差分进化算子,改变种群分布并引导搜索方向;最后,将该算法应用于亚马逊个性化搜索数据集,验证了其有效性.
个性化搜索差分进化算法Kalman滤波器代理模型偏差估计
基于多目标集成剪枝的多样内容在线生成方法摘要:在线生成多样内容是近年来程序化内容生成领域的新兴研究方向之一,不仅可以满足用户的不同偏好进而提升用户体验,也可以为人工智能算法的训练和测试提供海量的场景集和问题集.近期研究提出了基于负相关集成强化学习的多样内容在线生成方法,但此类方法无法有效地匹配不同用户的偏好.此外,训练与部署集成模型中的个体学习器需要消耗大量的计算资源.针对这两个问题,在负相关集成强化学习的框架下,本文提出了基于多目标集成剪枝的多样内容在线生成方法.该方法通过多目标优化算法搜索模型集成的权重,使获得的集成模型不仅能够有效地匹配给定的用户偏好,还能提供权衡模型性能与计算资源消耗的帕累托集.此方法通过调整个体学习器的集成权重来匹配用户需求,而非重新训练个体学习器,因此降低了计算资源消耗.
程序化内容生成在线内容生成多目标优化演化算法集成学习视频游戏
"新一代智能优化理论方法与应用暨郑大钟教授诞辰90周年"专刊前言摘要:优化问题无处不在.智能优化算法是基于计算智能的机制求解复杂问题最优或满意解的方法,通过对自然与社会系统中相关行为、功能、经验、规则、作用机理的认知,揭示优化的机理,凝练优化的机制,构建优化的框架与模型,进而在问题特征的导引下设计智能化的优化算法,力争取得优化性能的"稳、快、准",即优化结果的一致性、优化效率的快速性、优化质量的全局性.
集中训练分布执行下的多智能体强化学习综述摘要:近年来,多智能体强化学习(MARL)因其在解决实际问题上的巨大潜力而逐渐成为研究的热点.在复杂的多智能体系统中,集中式训练与分布式执行(CTDE)框架被广泛应用.CTDE通过集中训练的方式缓解了多智能体强化学习中的非平稳性问题,但也因此带来了新的挑战,特别是在训练过程中需要处理所有智能体的信息,尤其是随着智能体数量增加而呈指数级增长的联合动作空间.本文对CTDE框架下的多智能体强化学习算法及其发展进行了选择性的回顾,重点探讨了两大类算法:值函数分解方法和策略梯度方法.本文总结了这些算法在处理联合动作空间复杂性、非平稳性问题以及估计误差方面的表现,并提出了一些新的视角和思路,旨在为该领域的研究人员提供更深入的理解和未来研究的指导.
多智能体强化学习集中式训练分布式执行值函数分解强化学习
融合PLS子空间对齐和种群重用的多任务优化算法摘要:通过利用跨任务的知识转移,多任务优化可以实现比传统单任务优化更好的收敛性能.然而,在多任务优化中,搜索空间和优化场景的偏差以及干扰知识转移的噪声,都可能导致有效知识转移效率的降低,甚至出现负向迁移.为解决此问题,本文提出一种基于最小二乘法(PLS)子空间对齐和种群重用机制的多任务优化算法(PR-MTEA).首先,通过引入PLS子空间投影策略,将高维任务搜索空间向低维空间转化,并建立各任务所拥有种群的特定低维子空间;其次,实时调整子空间Bregman散度获取对齐矩阵,实现跨任务知识转移;最后,设计基于Residual残差结构的种群重用机制,避免出现负向迁移和陷入局部最优情况,并提高算法的收敛性能.实验结果表明:与其他4种先进多任务优化算法进行相比,PR-MTEA具有更好的收敛性能和快速搜索能力.另外,通过传感器覆盖问题进行测试分析,进一步验证算法的可行性和适用性.
多任务优化知识转移子空间对齐种群重用传感器覆盖问题
基于TCN-LSTM-Attention的建筑热动态与能耗预测摘要:基于暖通空调系统热动态与能耗的多变量耦合特点及数据预测精度不足的问题,本文提出一种融合时间卷积-长短期记忆-注意力机制(TCN-LSTM-Attention)的融合预测模型.首先,为了能够更加好捕获建筑运行数据中的短期与长期依赖,建立了TCN-LSTM-Attention建筑热动态与能耗预测模型来预测HVAC能耗、室内温度、PMV;采用改进粒子群算法(IPSO)优化预测模型超参数,降低模型预测误差,并对模型逼近能力进行分析;其次,使用En-ergyPlus搭建建筑仿真模型并进行验证;以河北省某办公建筑运行数据进行预测模型仿真验证,实验表明本模型在对比算法中有较好的预测精度和预测稳定性,并且验证了算法在建筑围护结构参数改变时的泛化性.
建筑状态预测时间卷积网络长短期记忆网络注意力机制粒子群优化算法
多智能体强化学习在微分博弈中的应用摘要:微分博弈是一种研究对抗环境下多智能体系统决策问题的方法,在经济、工程等领域都有着广泛的应用前景.然而当问题建模接近真实场景时,微分博弈的理论求解面临诸多困难.近年来,随着人工智能技术的快速发展,多智能体深度强化学习方法的研究取得了瞩目突破,为解决微分博弈所面临的挑战提供了新的思路.本文首先对这二者各自的原理、发展现状进行了梳理;之后详细介绍应用于微分博弈的强化学习算法,并根据微分博弈问题类别和网络模型进行细分,总结目前研究对传统方法所面临困难的解决情况;最后,对微分博弈与多智能体强化学习的发展现状进行分析,给出未来可能的研究方向.
强化学习微分博弈多智能体系统最优控制