长距离自主导航更稳定
一种基于改进好奇机制的深度确定性策略梯度方法,用于机器人在复杂环境中完成远距离自主导航任务。
Quanhu, Wang · Xu, Chenxi · Hongwei, Du · Yuxuan, Liu · Yang, Liu · Yujia, Fu · Kai, Li · Shi, Haobin
2023
将改进的好奇机制作为内部奖励探索策略,解决机器人在复杂环境中因缺乏外部奖励而无法完成任务的难题。
借助经验回放和双网络设计,学习率相比原始算法大幅提高。
仿真与真实实验结果表明,该方法在完成导航任务时更稳定。