稀疏奖励下学习更快
用势场统一子目标生成与到达两个阶段的学习目标,解决了现有方法中目标不一致导致的子目标学习效果受限问题。
Li, Shengze · Jiang, Hao · 刘云涛 · Zhang, Jieyuan · 徐新海 · Liu D.H.
Neural Networks 2024
用势场表示同时用于子目标选择和内在奖励,使生成与到达阶段优化同一目标。
状态到势场的表示模型可同时度量友方与敌方智能体的交互效应,适应对抗与协作混合场景。
子目标选择器从经验回放池中为每个智能体自动生成多个子目标,无需人工设计。
在 SMAC 和 GRF 的稀疏奖励设置中优于现有最优方法,证明方法在困难探索场景中的有效性。