非单调收益下保IGM
通过将分位数回归引入值分解,该算法在非单调收益场景下依然保持个体与全局最优动作的一致性,从而获得更优的纳什均衡。
Anqi, Huang · 王永莉 · Liu, Ruoze · Zou, Haochen · 74584845
Pattern Recognition 2025
通过调整量化因子,理论上证明了在非单调收益场景下IGM原则仍能保持,从而避免次优纳什均衡。
利用累计个体Q值近似联合Q值的上期望分位数,使分解过程偏向更优的经验轨迹。
为每个智能体设计的单调意图混合网络结合全局历史信息,确保分解过程单调,并使个体Q值隐式考虑其他智能体的意图。