双DQN协同控制器

收敛更快更稳

基于领导者-跟随者架构与双深度Q网络的决策控制器,将视线制导律与纵向速度、航向虚拟控制律结合,来解决UUV回收过程中参数难选与扰动鲁棒性问题。

冯景祥 · Yang, Cao · Fan, Xueman · Guang, Yang · Jingwei, Dong

IEEE Access 2025

技术优势

训练更快更稳

采用带固定Q目标的双DQN结构,降低训练算法复杂度,从而提升训练稳定性和效率。

无需人工调参

控制器基于DQN决策网络估计每个动作的期望累积奖励并选择最优动作,解决了控制器设计中参数选取的难题。

扰动下更鲁棒

将扰动信号作为DQN决策网络的输入并在训练中考虑,增强了其在扰动环境下的控制精度和鲁棒性。

应用场景