群体动态Q学习算法

多智能体博弈求解

用群体动态大幅降低非合作多智能体强化学习的均衡求解复杂度,在智能体数量增加时性能优势更显著。

Li, Junling · Hao, Zhang · Shuqi, Ke · 黄建伟 · 陳南 · Xuemin, Shen

IEEE Transactions on Network Science and Engineering 2025

技术优势

求解更快

用ODE描述群体演化,并通过两个关键机制降低求解ODE的复杂度,避免了直接计算均衡的高计算量。

复杂度可调

通过调整群体动态的迭代次数,可以在计算复杂度和均衡精度之间进行可控折中,适应不同算力条件。

多智能体更优

在三个智能体环境中性能超越现有均衡型MARL算法,显示出随智能体数量增加的性能优势。

应用场景