稀疏奖励显著提升
将混合动作空间分解为离散目标选择与连续动作执行,在稀疏奖励下显著优于现有方法。
Jiangyue, Yan · 罗彪 · Xu, Xiaodong
Artificial Intelligence Review 2024
将混合动作空间拆分为离散目标选择与连续动作执行,缩短决策序列,提升学习效率。
基于事后经验回放检测目标达成,缓解稀疏奖励问题,加速训练。
在离散和连续机器人环境上均验证有效,显著优于对比方法。