改进好奇机制DDPG导航控制器

长距离自主导航更稳定

一种基于改进好奇机制的深度确定性策略梯度方法,用于机器人在复杂环境中完成远距离自主导航任务。

Quanhu, Wang · Xu, Chenxi · Hongwei, Du · Yuxuan, Liu · Yang, Liu · Yujia, Fu · Kai, Li · Shi, Haobin

2023

技术优势

稀疏奖励下仍能学习

将改进的好奇机制作为内部奖励探索策略,解决机器人在复杂环境中因缺乏外部奖励而无法完成任务的难题。

学习速度大幅提升

借助经验回放和双网络设计,学习率相比原始算法大幅提高。

导航更稳定

仿真与真实实验结果表明,该方法在完成导航任务时更稳定。

应用场景