安全约束强化学习充电调度模型

约束合规下保持最优

将增强拉格朗日方法与软演员-评论家算法结合,在无需强凸性假设下高效求解带约束的充电站运行决策问题。

Yang, Lun · Guibin, Chen · 曹晓宇

Applied Energy 2025

技术优势

解约束问题更稳

通过将增强拉格朗日方法与软演员-评论家算法结合,算法在策略梯度中用拉格朗日价值函数更新,天然适合处理带约束的马尔可夫决策过程。

不需要严格凸性

算法不要求问题具有强凸性保证,因此可以应用于更广泛的充电站优化场景,包括非凸的定价或需求响应策略。

训练更省样本

采用双评论家网络估计动作值函数以避免过估计偏差,提升了样本效率,在真实电价实验中表现出色。

应用场景