双注意力近端策略优化算法

狭窄航道避碰更稳

通过分层处理观测信息并动态调整全局与局部权重,使强化学习模型在复杂环境中更准确地提取决策相关特征。

Shenhua, Yang · Kunjie, Wang · 王维军 · 吴华锋 · 索永峰 · 陈国权 · Jangfeng, Xian

Ocean Engineering 2025

参数信息

收敛速度提升
41.67 %
策略准确率提升
25 %
奖励波动降低
62.38 %

技术优势

收敛速度提升41.67%以上

通过动态调整全局与局部信息权重,模型能更快聚焦关键特征,减少无效探索。

策略准确率提高超过25%

分层注意力机制使特征提取更准确,智能体决策更可靠。

奖励波动降低超过62.38%

学习稳定性显著增强,训练过程更平稳。

应用场景