RNN-PPO逃逸引导策略

应对多追击器

结合循环神经网络的近端策略优化算法,为逃生飞行器生成引导指令,通过课程式训练逐步应对多追击飞行器。

Xiao, Hu · 王洪波 · Gong, Min · 王天舒

Aerospace 2024

技术优势

能对付多个追击器

策略通过逐步增加追击器数量的课程式训练,从单追击器扩展到多追击器,无需重新设计。

无需人工规则

利用深度强化学习直接从仿真交互中学习引导指令,替代依赖人工设计的制导律。

支持变长时间序列

引入循环神经网络处理追击器数量和逃逸时刻不确定的时序信息,提高策略适应性。

应用场景