连续空间实时避障
针对水下无人航行器在连续动作空间中的局部二维路径规划问题,提出一种改进的TD3深度强化学习算法,通过引入均值函数和动作存储机制,抑制边界动作输出并自适应调整权重,提升规划性能与部署效率。
褚振忠 · Yu, Wang · 朱大奇
IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024
在策略梯度中加入均值函数,使输出动作更接近动作空间均值,避免大量边界动作导致的退化。
基于经验回放缓冲区构建动作存储,实现权重系数的自动调节,减少超参数整定工作量。
在环境变量与奖励函数中引入实时声呐变量,使算法模型更符合真实水下航行情况。