自主避碰更稳更快
一种自适应探索强度的深度强化学习算法,通过量化学习不确定性,在训练早、中、后期动态调整探索力度,从而在复杂海事环境中获得更优的收敛性和鲁棒性。
王维军 · Mingjie, Li · 陈国权 · Shenhua, Yang · 索永峰 · Xiuqin, Guo · Kunjie, Wang
Engineering Applications of Artificial Intelligence 2026
训练初期通过主动增大探索强度,避免过早收敛到次优策略,为后续策略优化提供更优的初始解空间。
根据智能体的学习不确定性量化指标,在训练中期自适应调节探索力度,平衡探索与利用,加速收敛。
训练后期降低探索强度,使策略网络专注于利用已学到的知识,提高最终策略的稳定性和泛化能力。