势场子目标多智能体强化学习

稀疏奖励下学习更快

用势场统一子目标生成与到达两个阶段的学习目标,解决了现有方法中目标不一致导致的子目标学习效果受限问题。

Li, Shengze · Jiang, Hao · 刘云涛 · Zhang, Jieyuan · 徐新海 · Liu D.H.

Neural Networks 2024

技术优势

目标一致

用势场表示同时用于子目标选择和内在奖励,使生成与到达阶段优化同一目标。

能处理敌友交互

状态到势场的表示模型可同时度量友方与敌方智能体的交互效应,适应对抗与协作混合场景。

自动生成多个子目标

子目标选择器从经验回放池中为每个智能体自动生成多个子目标,无需人工设计。

稀疏奖励下效果显著

在 SMAC 和 GRF 的稀疏奖励设置中优于现有最优方法,证明方法在困难探索场景中的有效性。

应用场景