多智能体循环策略梯度导航算法

未知环境协同导航

每个无人机集中学习其他无人机的策略,解决环境不稳定导致的收敛慢问题,无需通信资源即可协调导航。

Yuntao, Xue · 陈为胜

IEEE Transactions on Intelligent Vehicles 2023

技术优势

无需通信

分散执行消除了无人机之间对通信资源的需求,降低系统复杂度和通信负担。

收敛更快

每个评论家网络集中学习,使每个无人机能估计其他无人机的策略,从而解决环境不稳定造成的收敛缓慢。

避免局部陷阱

添加 LSTM 网络使无人机能够利用历史探索信息改进动作值预测,避免陷入局部陷阱。

表现优于现有

在真实感仿真环境中的全面仿真结果表明,在收敛性和有效性方面优于最先进的 DRL 方法。

应用场景