可重构DDPG网络

事件触发抗高估

为移动机器人运动规划设计的深度强化学习网络,通过事件触发动态重构演员-评论家结构,结合自适应奖励与样本预处理,显著提升收敛速度与学习效率。

Sun, Huihui · Zhang, Changchun · Hu, Chunhe · Zhang, Junguo

Engineering Applications of Artificial Intelligence 2023

技术优势

收敛更快

事件触发可重构网络抑制动作价值高估,使动作价值估计偏差更小,从而缩短策略收敛时间。

样本更高效

通过双重经验回放缓冲区、可变比例采样和相似性判断三种样本预处理技术,提高经验样本的利用率。

离线表现更优

在大量实验中,所提方法优于对比方法,表明综合改进有效。

应用场景