多目标协作DDPG算法

更快学会更高更远跳跃

通过双DDPG网络协作和动态时间规整的经验优先回放,该算法在训练速度和收敛精度上均优于基线方法,实现双足机器人更高、更远的跳跃。

Tao, Chongben · Mengru, Li · 曹峰 · Gao, Zhen · Zhang, Zufeng

Advanced Intelligent Systems 2024

技术优势

更快学会

基于动态时间规整的恢复经验回放机制提高样本利用效率,使学习速度优于基线方法。

跳得更高更远

在PyBullet平台验证中,该方法实现了高度和距离显著增加的鲁棒跳跃。

应用场景