跟车行为高保真建模
用深度神经网络表达奖励函数,从驾驶数据中直接还原驾驶员的跟车策略,比传统线性逆强化学习精度更高。
Nan, Jiangfeng · Weiwen, Deng · Ruzheng, Zhang · Rui, Zhao · 王英 · Ding, Juan
IEEE Transactions on Intelligent Vehicles 2023
将配分函数的积分计算离散化为有限候选轨迹上的求和,避免传统 DIRL 中反复的强化学习最优策略求解,训练和推断开销大幅降低。
用深度神经网络表达奖励函数,突破传统 IRL 特征线性函数的拟合瓶颈,复现跟车行为更接近真实驾驶员。
从真实驾驶数据中直接学习出驾驶员的奖励函数,无需手动设计特征或先验假设,奖励函数的收敛性经 MPC 虚拟驾驶员数据验证。