推理性能最高提升86%
该网络通过随机初始化的自适应门控模块融合动作掩码与动作逻辑值,使智能体在优化过程中动态调整两者权重,从而显著提升策略优化效率与最终奖励表现。
Xue, Buqing · Qian, Chen · Zilong, Wang · Du, Linkang · Zhao, Jiaqi · 胡涛
Knowledge-Based Systems 2026
在四个 Gym 环境中,AGAM 推理阶段性能相比现有 SOTA 基线最高提升 86%,收敛后优势明显。
在水库调度多目标优化实验中,AGAM 能获得 Pareto 最优解,证明其在真实场景中的实用潜力。