TD3水下路径规划算法

连续空间实时避障

针对水下无人航行器在连续动作空间中的局部二维路径规划问题,提出一种改进的TD3深度强化学习算法,通过引入均值函数和动作存储机制,抑制边界动作输出并自适应调整权重,提升规划性能与部署效率。

褚振忠 · Yu, Wang · 朱大奇

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024

技术优势

抑制边界动作

在策略梯度中加入均值函数,使输出动作更接近动作空间均值,避免大量边界动作导致的退化。

自动调整权重

基于经验回放缓冲区构建动作存储,实现权重系数的自动调节,减少超参数整定工作量。

更贴近实际航行

在环境变量与奖励函数中引入实时声呐变量,使算法模型更符合真实水下航行情况。

应用场景