首页 | 本学科首页   官方微博 | 高级检索  
     检索      

拦截机动目标的信赖域策略优化制导算法
引用本文:陈文雪,高长生,荆武兴.拦截机动目标的信赖域策略优化制导算法[J].航空学报,2023(11):282-300.
作者姓名:陈文雪  高长生  荆武兴
作者单位:哈尔滨工业大学航天学院
基金项目:国家自然科学基金(12072090)~~;
摘    要:针对临近空间高超声速飞行器的高速性、机动性等特性,为提高制导算法针对不同初始状态、不同机动性目标的准确性、鲁棒性及智能性,提出一种基于信赖域策略优化(TRPO)算法的深度强化学习制导算法。基于TRPO算法的制导算法由2个策略(动作)网络、1个评价网络共同组成,将临近空间目标与拦截弹相对运动系统状态以端对端的方式直接映射为制导指令。在算法训练过程中合理选取连续动作空间、状态空间、并通过权衡能量消耗、相对距离等因素构建奖励函数加快其收敛速度,最终依据训练的智能体模型针对不同任务场景进行拦截测试。仿真结果表明:与传统比例导引律(PN)及改进比例导引律(IPN)相比,本文算法针对学习场景及未知场景均具有更小的脱靶量、更稳定的拦截效果、鲁棒性,并能够在多种配置计算机上广泛应用。

关 键 词:深度强化学习  信任域策略优化  临近空间拦截  导弹末制导  机动目标  马尔可夫过程
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号