任务课程MADRL

障碍密集下可避碰

针对多固定翼无人机在障碍密集环境中的避碰群集问题,提出一种任务特定课程式多智能体深度强化学习方法,通过子任务分解与渐进训练实现避碰群集策略学习。

Yan, Chao · 王菖 · 相晓嘉 · Kin Huat, Low · 王祥科 · 徐昕 · 沈林成

IEEE Transactions on Neural Networks and Learning Systems 2023

技术优势

策略更优

通过将复杂任务分解为多个子任务并渐进式增加难度,课程式训练使得最终的群集避碰策略在性能上更优。

样本效率高

提出的缓冲区重用离线迁移机制利用了先前阶段的经验,使得样本利用率提升,训练所需的交互次数减少。

学习更稳定

模型重载与缓冲区重用两种迁移机制在相邻阶段间传递知识,使得训练过程更加稳定,避免性能大幅波动。

硬件在环验证

通过高保真硬件在环仿真验证了所提方法在实际系统中的适应性,表明其能够迁移到真实硬件。

应用场景