历史相似性奖励强化学习

指导暂停后不掉队

通过基于历史相似性的补偿奖励,该方法在人类指导暂停后仍能维持学习性能,并直接优化策略以避免价值函数拟合的累积误差。

Lifei, Dai · 张长柱 · Hao, Zhang · Ji, Yuxiong · 严怀成

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2025

参数信息

最优性能提升
15 %

技术优势

指导暂停不掉队

通过基于历史相似性的补偿奖励,即使不再提供人类指导,代理也能继续获得学习信号,保持性能不下降。

不用价值函数也能学

提出一种直接优化策略的强化学习范式,绕开价值函数拟合,从而避免拟合新奖励(包括补偿奖励)时产生的累积误差。

长尾问题也能调

该范式支持对强化学习代理进行微调,以应对自动驾驶中的长尾问题,提升在罕见场景下的表现。

应用场景