平均胜率提升超15%
用动态加权而非静态求和分解集中式评判器,让多智能体策略梯度在大规模、部分可观测环境下仍能准确分配贡献、稳定提升协作表现。
丁世飞 · Xiaomin, Dong · Zhang, Jian · 郭丽丽 · Wei, Du · Zhang, Chenglong
Pattern Recognition 2025
动态加权非线性非单调分解使每个智能体的价值函数贡献被更准确地估计,减少因全局回报分配偏差导致的训练震荡。
DXM 在离散动作空间(SMAC)和连续动作空间(连续捕食者-猎物)上均能有效学习策略,无需针对动作空间类型调整算法框架。
相比其他基线方法,DXM 在多个测试环境中实现平均胜率提升超过 15%,显著提升协作任务成功率。