异构智能体镜像下降算法

胜率逾九成五

一种面向异构智能体协作的策略镜像下降算法,利用技能博弈迭代提升团队对抗策略质量。

罗俊仁 · 张万鹏 · Su, Jiongming · Wang, Zhanling · 陈璟

Neurocomputing 2026

参数信息

胜率
95.4 %

技术优势

环境信息不全也能学

采用策略镜像下降和在线凸优化理论,在信息不完全时仍能收敛到均衡策略。

策略数量自动扩展

通过Set-PSRO方法以自博弈或交叉博弈自动发现技能并强化策略种群,应对不同难度的对抗。

新任务微调即用

在非对称博弈网络中,通过微调预训练技能模型即可快速生成在线策略。

应用场景