双层强化学习框架

集成决策与规划

面向自动驾驶多时间尺度任务的集成决策与运动规划闭环方案,兼顾安全、效率与舒适性。

Liao, Yaping · 余贵珍 · 陈鹏 · 周彬 · Han, Li

IEEE Transactions on Vehicular Technology 2023

技术优势

闭环优化

通过前向决策输出指导和反向运动规划反馈优化,形成闭环机制,持续改进决策策略。

多目标兼顾

上层奖励函数同时考虑安全性、效率、舒适性和决策执行,使决策在多个目标间取得平衡。

性能提升

与四种基准方法相比,所提出框架展现出增强的驾驶性能。

应用场景