经济环保安全兼顾
一种可解释的分层强化学习方法,通过多评论家单演员结构解耦奖励,可同时优化经济性、环保性和运行安全约束,并能在不确定性下快速在线决策。
Dou, Jiaming · 王小君 · Liu, Zhao · Jiao, Zhijie · Yi, Han · 孙庆凯 · 和敬涵
Computers and Electrical Engineering 2024
每个目标使用独立的深度评论家网络,奖励解耦,避免了多目标强化学习中常见的冲突和互相干扰。
算法结构设计和SHAP分析揭示了各特征对调度决策的贡献,使AI决策过程透明可理解。
H-DRL在包含可再生能源不确定性的综合环境中离线训练,并能在线提供快速决策。