层级强化学习框架

堆垛成功率94.8%

针对非结构化环境下机械臂长时序任务的层级强化学习方法,将玩具清理任务成功率从78.3%提升到94.8%,训练速度较基线方法快近三倍。

王斐 · Liu, Yue · Manyi, Shi · Chen, Chao · Liu, Shangdong · Jinbiao, Zhu

Journal of Intelligent and Robotic Systems: Theory and Applications 2024

参数信息

任务成功率
94.8 %
训练加速比
3

技术优势

长任务不再脱节

框架将抓取与后续堆叠、装配等环节统一规划,避免只优化抓取导致后续失败。

训练快近三倍

在堆叠玩具实验中,训练速度比基线方法快近三倍,降低训练时间成本。

复杂任务更占优

任务越复杂,框架相较于基线的优势越大,适合推广到其他长时序任务。

应用场景