基于一种改进PPO算法的无人机空战自主机动决策方法研究
张欣1
董文瀚1
尹晖2
贺磊1
张聘1
李敦旺1
1.空军工程大学航空工程学院,西安,7100382.空军工程大学教研保障中心,西安,710051
摘要:深度强化学习的应用为无人机自主机动决策提供了新的可能.提出一种基于态势评估模型重构与近端策略优化(PPO)算法相结合的无人机自主空战机动决策方法,为一对一近距空战提供了有效策略选择.首先,建立高保真六自由度无人机模型与近距空战攻击模型;其次,基于空战状态划分重构角度、速度、距离和高度态势函数,提出一种描述机动潜力的新型态势评估指标;之后,基于态势函数设计塑形奖励,并与基于规则的稀疏奖励、基于状态转换的子目标奖励共同构成算法奖励函数,增强了强化学习算法的引导能力;最后,设计专家系统作为对手,在高保真空战仿真平台(JSBSim)中对本文工作进行了评估.仿真验证,应用本文方法的智能体在对抗固定机动对手与专家系统对手时算法收敛速度与胜率都得到了有效提升.
关键词:PPO算法机动潜力六自由度飞机模型态势函数近距空战专家系统
分类号:V279.3(各类型航空器)
资助基金:国家自然科学基金(62303362)
论文发表日期:2024-12-25
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:10( 77-86 )
英文信息
