传递强化学习算法

该算法通过传递学习和强化学习实现多智能体在复杂障碍环境下的编队控制,有效避免负迁移,提升泛化能力和收敛速度。

Hu, Penglin · 潘泉 · Guo, Yaning · 赵春晖

Xibei Gongye Daxue Xuebao/Journal of Northwestern Polytechnical University 2023

技术优势

存储需求大幅降低

采用价值函数逼近方法,将Q表所需的巨大存储空间转化为参数存储,从而降低了算法对内存的依赖。

求解速度更快

价值函数逼近方法不仅降低了存储需求,还同时提升了算法的求解速度,使编队控制更高效。

避免负迁移

通过高斯聚类对源任务分类,并选择与目标任务距离最近的源任务类进行学习,有效避免了负迁移现象。

泛化能力更强

通过选择最优源任务类进行学习,算法的泛化能力和收敛速度均得到提升,能更好适应新任务。