陌生工况成本降38.8%
通过激励奖励与速度转移概率预训练,让智能体在陌生驾驶循环下快速学到接近离线动态规划的最优功率分配策略。
Fei, Li · Yang, Gao · Wu, Yue · Xia, Yaoxin · Wang, Chenglong · Jiajian, Hu · 黄志武
Energy Conversion and Management 2023
通过随机采样构建速度转移概率面进行预训练,策略在未见过驾驶循环中仍保持近优性能。
结合广义优势估计与层归一化,学习收敛性显著提升,使策略迅速逼近最优。
激励奖励函数基于超级电容荷电状态与车辆加速度设计,在负载功率高时刺激智能体学习到更优的功率分配。