应对多追击器
结合循环神经网络的近端策略优化算法,为逃生飞行器生成引导指令,通过课程式训练逐步应对多追击飞行器。
Xiao, Hu · 王洪波 · Gong, Min · 王天舒
Aerospace 2024
策略通过逐步增加追击器数量的课程式训练,从单追击器扩展到多追击器,无需重新设计。
利用深度强化学习直接从仿真交互中学习引导指令,替代依赖人工设计的制导律。
引入循环神经网络处理追击器数量和逃逸时刻不确定的时序信息,提高策略适应性。