激励学习能量管理策略

陌生工况成本降38.8%

通过激励奖励与速度转移概率预训练,让智能体在陌生驾驶循环下快速学到接近离线动态规划的最优功率分配策略。

Fei, Li · Yang, Gao · Wu, Yue · Xia, Yaoxin · Wang, Chenglong · Jiajian, Hu · 黄志武

Energy Conversion and Management 2023

参数信息

成本降低幅度(预训练驾驶循环)
5.8-13.8 %
成本降低幅度(测试驾驶循环)
11.7-38.8 %

技术优势

陌生工况也最优

通过随机采样构建速度转移概率面进行预训练,策略在未见过驾驶循环中仍保持近优性能。

学得快,省成本

结合广义优势估计与层归一化,学习收敛性显著提升,使策略迅速逼近最优。

高负载下更省

激励奖励函数基于超级电容荷电状态与车辆加速度设计,在负载功率高时刺激智能体学习到更优的功率分配。

应用场景