多智能体多目标强化学习框架

帕累托最优能源管理

通过值函数分解与策略梯度结合,使综合能源系统能源管理能够同时优化多个目标并逼近帕累托前沿,提供比单目标方法更灵活、可解释的多维决策能力。

Dou, Jiaming · 王小君 · Liu, Zhao · 孙庆凯 · Wang, Xihao · 和敬涵

International Journal of Electrical Power and Energy Systems 2024

技术优势

覆盖更广目标空间

通过直接逼近帕累托前沿而不是标量化的单一解,决策者能够获得多个非支配解,从而在更广泛的权衡空间中进行选择。

融入安全约束

在帕累托前沿上设置安全阈值,形成带安全条件的帕累托优化,确保系统在追求多个目标的同时安全运行。

决策更灵活可解释

相比传统DRL方法,该框架提供更灵活、可解释的多维决策能力,使决策者能够根据偏好从帕累托解集中选择。

应用场景