深度强化学习制导律

训练效率倍增

用可信搜索策略改进深度确定性策略梯度算法,使导弹在干扰下更稳定地拦截带诱饵的机动目标。

Deng, Tianbo · Hao, HUANG · 方洋旺 · 闫杰 · 程昊宇

Chinese Journal of Aeronautics 2023

技术优势

自主辨识干扰

采用能量中心法将目标和诱饵等效为虚拟目标,导弹无需预先区分真假,降低了对传感器精度的依赖。

学习更快更稳

引入可信搜索策略改进DDPG,显著提高训练效率,使制导律能更快适应复杂战场环境。

应对机动更鲁棒

通过蒙特卡洛测试验证了制导律对目标机动和环境不确定性的鲁棒性,拦截性能优于其他对比方法。

应用场景