训练快四成 奖励高两成
用专家演示引导探索,再动态放手让智能体在真实工况下自寻近似最优,兼顾收敛速度与控制效果。
刘伟荣 · Pengfei, Yao · Wu, Yue · Lijun, Duan · 李恒 · 彭军
Applied Energy 2025
专家演示将强化学习智能体的初始动作引向最优功率分配映射附近,大幅减少无效试错。
动态模仿权重使智能体在模仿与自主探索之间平滑过渡,最终获得更高的累计奖励。
在不同测试驾驶循环下,该方法进一步降低电池容量损失成本,最高达12.4%。