共识构建强化学习网络

抗拒集群自动降权

用多智能体深度Q网络驱动决策者聚类,对不合作群体动态施加权重惩罚,从而快速收敛共识。

Tu, Yan · Wenshuo, Wang · Zhuang, Ma · 李宗敏 · Lev, Ben

Information Fusion 2026

技术优势

更快达成共识

相比传统GDM方法和其他强化学习方法,本方法在共识质量与决策效率上均更优,所需迭代更少。

自适应抑制不合作

通过权重惩罚机制降低抗拒集群的影响力,从而提升共识效率。

减少偏好调整

在时间敏感场景下,本方法能减少达成共识所需的偏好调整次数。

应用场景