多智能体去噪扩散策略

免分布假设可扩展

一种利用扩散模型为多智能体联合状态-动作价值分布建模的策略梯度算法,可有效捕捉多模态分布,摆脱传统方法对价值分布形式的先验假设。

钟山 · 王刚 · Jingkui, Zhang · Wang, Xiaoyang · Teh, Kah Chan · He, Diao · 张萍 · He, Jiacheng · Zhi, Zeng · Cheng, Teehiang · 彭倍

Information Fusion 2026

技术优势

摆脱分布先验假设

扩散模型天然具备多模态建模能力,无需预设原子分布或分位数形式,即可拟合复杂的联合价值分布。

在线训练可优化

引入K次重复采样与TD目标,高效优化条件变分证据下界,无需真实价值样本。

性能显著超越基线

在MPE和MuJoCo环境中的实验表明,MAD3PG显著优于基于确定性价值估计的传统算法。

理论收敛保证

论文给出了MAD3PG的理论收敛性分析,为算法可靠性提供支撑。

应用场景