M-DQN移动机器人

收敛更快

采用改进的ε-UCB动作选择策略和多目标融合奖励函数,在复杂环境下实现更高效的路径规划学习。

盛春阳 · An, Hao · 聂君 · 王海霞 · 卢晓

IEEE Transactions on Vehicular Technology 2025

技术优势

探索更高效

采用基于神经网络的ε-UCB方法拟合状态-动作对的不确定性,从而提升探索效率。

引导能力更强

多目标融合奖励函数增强了奖励信号对学习过程的引导作用。

收敛更快

实验表明,所提方法在复杂环境中的收敛速度和学习效率均优于现有方法。

应用场景