收敛更快
采用改进的ε-UCB动作选择策略和多目标融合奖励函数,在复杂环境下实现更高效的路径规划学习。
盛春阳 · An, Hao · 聂君 · 王海霞 · 卢晓
IEEE Transactions on Vehicular Technology 2025
采用基于神经网络的ε-UCB方法拟合状态-动作对的不确定性,从而提升探索效率。
多目标融合奖励函数增强了奖励信号对学习过程的引导作用。
实验表明,所提方法在复杂环境中的收敛速度和学习效率均优于现有方法。