对抗式模仿强化学习策略

训练快四成 奖励高两成

用专家演示引导探索,再动态放手让智能体在真实工况下自寻近似最优,兼顾收敛速度与控制效果。

刘伟荣 · Pengfei, Yao · Wu, Yue · Lijun, Duan · 李恒 · 彭军

Applied Energy 2025

参数信息

训练加速比
42.60 %
奖励提升
15.79 %
电池容量损失成本降低
5.1–12.4 %

技术优势

训练加速四成

专家演示将强化学习智能体的初始动作引向最优功率分配映射附近,大幅减少无效试错。

奖励提升15.79%

动态模仿权重使智能体在模仿与自主探索之间平滑过渡,最终获得更高的累计奖励。

容量损失再降12.4%

在不同测试驾驶循环下,该方法进一步降低电池容量损失成本,最高达12.4%。

应用场景