持续改进自动驾驶
一种强化学习技术,保证自动驾驶汽车随着更多训练数据持续提升或维持性能,无需长时间预训练阶段。
Cao, Zhong · 江昆 · 周维涛 · Xu, Shaobing · Huei, Peng · 杨殿阁
Nature Machine Intelligence 2023
通过一种动态信心感知强化学习技术,该算法可以保证更多的训练数据总是能提升或至少维持当前性能。
该技术能够在行驶过程中使用新数据进行在线学习,从而避免了传统强化学习方法中长时间预训练阶段。
在任何阶段,该方法的性能都至少达到默认策略的水平,并在多种情况下优于默认策略。