基于增量式策略强化学习算法的飞行控制系统的容错跟踪控制
任坚
刘剑慰
杨蒲
1.南京航空航天大学自动化学院,江苏南京2111062.南京航空航天大学自动化学院,江苏南京2111063.南京航空航天大学自动化学院,江苏南京211106
摘要:针对发生故障的飞行控制系统,在强化学习算法的基础上,提出了一种基于增量式策略的强化学习容错方法.本方法利用传感器获取的系统状态值,根据系统预先设定的奖励函数对当前控制系统状况做出最优的决策并不断更新价值网络,将系统的容错控制过程转换为强化学习Agent的贯序决策过程,并使用一种改进型的增量式策略实现对当前故障的正确补偿策略的逐渐逼近.同时,针对连续控制系统,提出一种状态转移预测网络来得到下一步状态值.最后,通过南京航空航天大学"先进飞行器导航、控制与健康管理"工信部重点实验室的飞行器故障诊断实验平台验证了该方法的有效性.
关键词:飞行控制系统故障诊断故障容错强化学习Q-learning算法增量式策略状态转移预测网络
资助基金:民航飞机健康监测与智能维护重点实验室基金项目(NJ2018012)中央高校基本科研业务费专项(NS2017017)国家自然科学基金(61533008)国家自然科学基金(61490703)
论文发表日期:2020-07-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:10( 1429-1438 )
英文信息展开
控制理论与应用

控制理论与应用

北大核心CSTPCDEI
ISSN:1000-8152
年,卷(期):2020,37(7)
所属栏目:论文与报告