分位值分解策略

非单调收益下保IGM

通过将分位数回归引入值分解,该算法在非单调收益场景下依然保持个体与全局最优动作的一致性,从而获得更优的纳什均衡。

Anqi, Huang · 王永莉 · Liu, Ruoze · Zou, Haochen · 74584845

Pattern Recognition 2025

技术优势

非单调收益下也能保IGM

通过调整量化因子,理论上证明了在非单调收益场景下IGM原则仍能保持,从而避免次优纳什均衡。

优先优化高质量轨迹

利用累计个体Q值近似联合Q值的上期望分位数,使分解过程偏向更优的经验轨迹。

混合网络单调性可证明

为每个智能体设计的单调意图混合网络结合全局历史信息,确保分解过程单调,并使个体Q值隐式考虑其他智能体的意图。

应用场景