多阶段自训练社交机器人检测模型

少量标签高效检测

一个利用伪标签扩充数据并多阶段训练图神经网络的社交机器人检测模型,通过减少伪标签噪声提升检测性能。

Keke, Wang · 王秀娟 · Kangmiao, Chen · Zhengxiang, Wang · 郑康锋

Engineering Applications of Artificial Intelligence 2025

参数信息

Twibot-20 数据集上的准确率
0.9259
Cresci-2015 数据集上的准确率
0.9979
Twibot-22 数据集上的准确率
0.8358
相对现有最优方法的提升幅度(Twibot-20)
5.68 %
相对现有最优方法的提升幅度(Cresci-2015)
2.64 %
相对现有最优方法的提升幅度(Twibot-22)
3.92 %

技术优势

少标签也能高精度

从少量标注数据出发,通过多阶段自训练逐步提升模型性能,避免大规模人工标注的成本。

伪标签噪声更少

引入不确定性感知和深度聚类来筛选和修正伪标签,减少错误标注对训练的干扰,让模型学得更干净。

三个基准上都大幅领先

在 Twibot-20、Cresci-2015、Twibot-22 上准确率分别达到 0.9259、0.9979、0.8358,比当前最优方法分别提升 5.68%、2.64%、3.92%,证明方法在不同规模和类型的数据上都有稳定优势。

应用场景