自动驾驶决策智能体

训练快且驾驶更安全

同时利用演示与交互数据训练的强化学习智能体,解决了梯度冲突导致的训练停滞,可直接部署于实车。

Shan, Zitong · 赵健 · Huang, Wenhui · Yang, Zhao · Ge, Linhe · Zhong, Shouren · 胡宏宇 · Lv, Chen · 朱冰

Transportation Research, Part C: Emerging Technologies 2025

技术优势

训练不卡住

通过梯度投影技术缓解演示数据和交互数据之间的梯度冲突,防止学习停滞,让训练过程持续推进。

能上真车

该方法已部署到真实自动驾驶车辆上,并在增强现实实验中验证,初步解决了从仿真到现实的迁移问题。

应用场景