最大熵深度逆强化学习模型

跟车行为高保真建模

用深度神经网络表达奖励函数,从驾驶数据中直接还原驾驶员的跟车策略,比传统线性逆强化学习精度更高。

Nan, Jiangfeng · Weiwen, Deng · Ruzheng, Zhang · Rui, Zhao · 王英 · Ding, Juan

IEEE Transactions on Intelligent Vehicles 2023

技术优势

计算更快

将配分函数的积分计算离散化为有限候选轨迹上的求和,避免传统 DIRL 中反复的强化学习最优策略求解,训练和推断开销大幅降低。

建模更准

用深度神经网络表达奖励函数,突破传统 IRL 特征线性函数的拟合瓶颈,复现跟车行为更接近真实驾驶员。

能学到奖励

从真实驾驶数据中直接学习出驾驶员的奖励函数,无需手动设计特征或先验假设,奖励函数的收敛性经 MPC 虚拟驾驶员数据验证。

应用场景