衰减多目标Q学习

动态避障更敏捷

通过衰减模型重塑Q值传播机制,同时缓解稀疏奖励与值不稳定,实现更快的收敛和更高的路径质量。

Li, Dongdong · 唐敦兵 · Liu, Changchun · 张泽群 · 王磊

Knowledge-Based Systems 2026

参数信息

收敛速度提升
30 %
路径长度缩短
12 %
转弯次数减少
20 %

技术优势

收敛更快

通过衰减模型重塑Q值传播,缓解稀疏奖励和值不稳定,加速学习过程。

路径更优

多衰减因子分别调节路径长度和转弯频率,使规划结果更符合实际需求。

动态避障更强

邻近感知Q值调整策略能快速适应动态障碍,支持多智能体场景下的突发冲突避免。

应用场景