加权平均场Q学习算法

适应大规模智体差异

该算法通过时间补偿多头注意力结构构建加权平均场框架,将群体内复杂关系转化为智能体与加权虚拟平均智能体的交互,从而更全面地表示群体行为,适用于不同规模的多智能体系统。

Zhuoying, Chen · 李慧平 · Zhaoxu, Wang · Yan, Bing

IEEE Transactions on Industrial Informatics 2025

技术优势

不丢个体差异

时间补偿多头注意力结构将群体内部复杂关系转化为智能体与加权虚拟平均智能体的交互,使平均Q函数能全面表示群体行为。

少掉进局部最优

混合经验回放机制丰富了样本多样性,防止算法陷入局部最优解。

应用场景