训练收敛快32%
将生成对抗模仿学习与TD3深度强化学习结合,用离线动态规划轨迹提供专家引导,缓解冷启动问题,加速连续空间中的策略训练,并实现宏观功率分配与微观系统调节的统一控制。
Xueshun, Li · Jinghui, Xu · Juanzhang, Xie · Wang, Ziyi · Jinxu, Cai · Lanxin, Zhang · 赵拥军
Aerospace Science and Technology 2026
GAIL利用离线动态规划轨迹提供专家引导,缓解冷启动问题并加速TD3在连续空间的训练。
通过协调燃料电池与电池的动态负载分配并精确调节压缩机压比,实现了接近离线DP基准的生命周期成本,增幅仅为1.22%。
该策略成功将燃料电池与严重的高频随机负载扰动隔离,展现出卓越的鲁棒性。