认知熵近端策略优化算法

自主避碰更稳更快

一种自适应探索强度的深度强化学习算法,通过量化学习不确定性,在训练早、中、后期动态调整探索力度,从而在复杂海事环境中获得更优的收敛性和鲁棒性。

王维军 · Mingjie, Li · 陈国权 · Shenhua, Yang · 索永峰 · Xiuqin, Guo · Kunjie, Wang

Engineering Applications of Artificial Intelligence 2026

技术优势

提前规避局部最优

训练初期通过主动增大探索强度,避免过早收敛到次优策略,为后续策略优化提供更优的初始解空间。

自适应调节探索

根据智能体的学习不确定性量化指标,在训练中期自适应调节探索力度,平衡探索与利用,加速收敛。

增强最终策略稳定性

训练后期降低探索强度,使策略网络专注于利用已学到的知识,提高最终策略的稳定性和泛化能力。

应用场景