成本较MPC低30%
基于TD3强化学习的无模型能量与热管理联合策略,摆脱对系统模型和未来交通信息的依赖,实现实时求解并显著降低油耗与电池老化。
李凯 · 陈虹 · 吴玉虎 · Jing, Zhao · 丁世宏 · 高金武
IEEE Transactions on Intelligent Vehicles 2024
基于TD3强化学习的策略不依赖于精确系统模型和未来交通信息,提升了在真实复杂工况下的适应性。
联合策略的总优化成本达到动态规划策略的91.42%,比模型预测控制策略低30.3%。
在线计算负担仅为MPC策略的0.19%,具备很强的实时应用潜力。