启发式改进A2C干扰决策算法

收敛快三成

不依赖先验信息的认知干扰决策算法,通过基线对偶网络与启发式奖励降低方差,收敛速度较改进A2C再提升31.58%。

Chudi, Zhang · Biao, Yang · Lei, Wang · Wenshuai, Ji · Wang, Lulu · 徐世友

IEEE Transactions on Vehicular Technology 2024

参数信息

收敛速度提升(对比DQN)
50 %
收敛速度提升(对比Policy Gradient)
57.8 %
收敛速度提升(对比Actor-Critic)
34.5 %
收敛速度提升(对比A2C)
13.64 %
收敛速度提升(启发式改进A2C对比改进A2C)
31.58 %

技术优势

收敛更快

通过引入基线函数和对偶网络降低批评者网络的方差,从而增强A2C算法的收敛性。

无需先验信息

改进后的A2C算法不依赖先验信息,增强了干扰机与目标雷达交互时的自适应能力。

启发式奖励再提速

引入启发式奖励函数后,收敛速度比改进A2C算法再提高31.58%。

应用场景