异构智能体镜像下降算法
胜率逾九成五
一种面向异构智能体协作的策略镜像下降算法,利用技能博弈迭代提升团队对抗策略质量。
罗俊仁 · 张万鹏 · Su, Jiongming · Wang, Zhanling · 陈璟
Neurocomputing 2026
参数信息
- 胜率
- 95.4 %
技术优势
环境信息不全也能学
采用策略镜像下降和在线凸优化理论,在信息不完全时仍能收敛到均衡策略。
策略数量自动扩展
通过Set-PSRO方法以自博弈或交叉博弈自动发现技能并强化策略种群,应对不同难度的对抗。
新任务微调即用
在非对称博弈网络中,通过微调预训练技能模型即可快速生成在线策略。
应用场景
- 多智能体协作控制:在信息不全环境下学习收敛的协作策略,用于多机器人任务分配。
- 群体机器人博弈策略:通过自博弈自动扩展技能,应对不同难度的群体对抗。
- 机器人足球决策:在谷歌足球环境中Elo分数超越内置算法,可用于足球机器人决策。
- 协作机械臂调度:学习异构智能体协作策略,用于多机械臂协同操作。
- 人形机器人协同:通过微调预训练技能模型快速生成在线策略,用于人形机器人协同。