分层多目标导航算法

稀疏奖励显著提升

将混合动作空间分解为离散目标选择与连续动作执行,在稀疏奖励下显著优于现有方法。

Jiangyue, Yan · 罗彪 · Xu, Xiaodong

Artificial Intelligence Review 2024

技术优势

分解动作空间

将混合动作空间拆分为离散目标选择与连续动作执行,缩短决策序列,提升学习效率。

动态检测目标

基于事后经验回放检测目标达成,缓解稀疏奖励问题,加速训练。

优于现有方法

在离散和连续机器人环境上均验证有效,显著优于对比方法。

应用场景