事件触发抗高估
为移动机器人运动规划设计的深度强化学习网络,通过事件触发动态重构演员-评论家结构,结合自适应奖励与样本预处理,显著提升收敛速度与学习效率。
Sun, Huihui · Zhang, Changchun · Hu, Chunhe · Zhang, Junguo
Engineering Applications of Artificial Intelligence 2023
事件触发可重构网络抑制动作价值高估,使动作价值估计偏差更小,从而缩短策略收敛时间。
通过双重经验回放缓冲区、可变比例采样和相似性判断三种样本预处理技术,提高经验样本的利用率。
在大量实验中,所提方法优于对比方法,表明综合改进有效。