差值因子分解网络

非单调环境最优

通过将IGM原理转化为等价差值形式,在非单调回报矩阵与复杂协作任务中稳定恢复最优策略。

Anqi, Huang · 王永莉 · Sang, Jianghui · Wang, Xiaoli · Yupeng, Wang

Knowledge-Based Systems 2024

技术优势

非单调下仍最优

DVF-IGM是IGM的等价变换,在非单调矩阵博弈中保持并恢复最优策略,而现有方法在此类场景中失效。

策略单调改进

DVF保证联合策略的单调改进,避免了训练过程中的性能震荡。

SMAC性能领先

在星际争霸多智能体挑战的协作任务中取得最先进性能,验证了方法的有效性和泛化能力。

应用场景