非单调环境最优
通过将IGM原理转化为等价差值形式,在非单调回报矩阵与复杂协作任务中稳定恢复最优策略。
Anqi, Huang · 王永莉 · Sang, Jianghui · Wang, Xiaoli · Yupeng, Wang
Knowledge-Based Systems 2024
DVF-IGM是IGM的等价变换,在非单调矩阵博弈中保持并恢复最优策略,而现有方法在此类场景中失效。
DVF保证联合策略的单调改进,避免了训练过程中的性能震荡。
在星际争霸多智能体挑战的协作任务中取得最先进性能,验证了方法的有效性和泛化能力。