启发式改进A2C干扰决策算法
收敛快三成
不依赖先验信息的认知干扰决策算法,通过基线对偶网络与启发式奖励降低方差,收敛速度较改进A2C再提升31.58%。
Chudi, Zhang · Biao, Yang · Lei, Wang · Wenshuai, Ji · Wang, Lulu · 徐世友
IEEE Transactions on Vehicular Technology 2024
参数信息
- 收敛速度提升(对比DQN)
- 50 %
- 收敛速度提升(对比Policy Gradient)
- 57.8 %
- 收敛速度提升(对比Actor-Critic)
- 34.5 %
- 收敛速度提升(对比A2C)
- 13.64 %
- 收敛速度提升(启发式改进A2C对比改进A2C)
- 31.58 %
技术优势
收敛更快
通过引入基线函数和对偶网络降低批评者网络的方差,从而增强A2C算法的收敛性。
无需先验信息
改进后的A2C算法不依赖先验信息,增强了干扰机与目标雷达交互时的自适应能力。
启发式奖励再提速
引入启发式奖励函数后,收敛速度比改进A2C算法再提高31.58%。
应用场景
- 电子战决策:用于认知电子战中实时决策,替代传统固定规则的干扰策略选择。
- 智能干扰:根据雷达状态动态选择干扰样式,实现自适应智能干扰。
- 雷达对抗:无需先验信息即可在与目标雷达交互中做出干扰决策。
- 认知无线电:将深度强化学习用于频谱对抗,为认知无线电提供干扰决策能力。