MT-MAPPO多智能体优化框架

混合博弈均衡

面向综合能源系统的双尺度优化,融合图神经网络与集中训练分散执行机制,实现供应商—用户垂直博弈与用户间横向竞争的高效均衡求解。

Li, Wenzhuo · Li, Donghe · Shuo, Hou · 席奂 · Yu, Xiao · Yang, Qing-Yu

Applied Energy 2026

参数信息

平均奖励提升率(对比MADDPG)
16.2 %
平均奖励提升率(对比MADQN)
5.4 %

技术优势

求解双层博弈

构建纵向Stackelberg与横向竞争的双博弈结构,同时处理供应商-用户层级关系和用户间点对点竞争,而现有方法难以有效处理。

加速收敛

采用集中训练分散执行(CTDE)和策略裁剪机制,实现良好的收敛速度和训练稳定性,缩短优化迭代时间。

奖励更高

实验验证平均奖励分别比MADQN和MADDPG高出5.4%和16.2%,系统优化效果更优。

跨时间尺度协同

通过前向仿真和滚动优化实现跨时间尺度协同,在不同时间决策层级间传递信息与价值反馈,提升整体优化效果。

应用场景