该方法通过改进的深度强化学习算法,在降低住宅能源成本的同时兼顾热舒适与电动汽车续航,对剧烈波动的环境具有鲁棒性。
王灿 · Jiaheng, Zhang · Wang, Aoqi · Zhen, Wang · 杨楠 · 赵卓立 · Lai C.S. · Lai, Loi Lei
Applied Energy 2024
在环境不确定性剧烈波动时仍能保持优化性能,因为优先经验回放使智能体专注于重要经验,TD3抑制过估计。
通过优先回放高价值的经验,智能体更快学到最优策略,从而减少训练时间或提高样本利用率。
TD3本身适用于多维连续动作空间,能够对住宅微电网的多个设备进行更精细的优化。