多阶段自训练社交机器人检测模型
少量标签高效检测
一个利用伪标签扩充数据并多阶段训练图神经网络的社交机器人检测模型,通过减少伪标签噪声提升检测性能。
Keke, Wang · 王秀娟 · Kangmiao, Chen · Zhengxiang, Wang · 郑康锋
Engineering Applications of Artificial Intelligence 2025
参数信息
- Twibot-20 数据集上的准确率
- 0.9259
- Cresci-2015 数据集上的准确率
- 0.9979
- Twibot-22 数据集上的准确率
- 0.8358
- 相对现有最优方法的提升幅度(Twibot-20)
- 5.68 %
- 相对现有最优方法的提升幅度(Cresci-2015)
- 2.64 %
- 相对现有最优方法的提升幅度(Twibot-22)
- 3.92 %
技术优势
少标签也能高精度
从少量标注数据出发,通过多阶段自训练逐步提升模型性能,避免大规模人工标注的成本。
伪标签噪声更少
引入不确定性感知和深度聚类来筛选和修正伪标签,减少错误标注对训练的干扰,让模型学得更干净。
三个基准上都大幅领先
在 Twibot-20、Cresci-2015、Twibot-22 上准确率分别达到 0.9259、0.9979、0.8358,比当前最优方法分别提升 5.68%、2.64%、3.92%,证明方法在不同规模和类型的数据上都有稳定优势。
应用场景
- 社交网络安全:用少量标注数据就可部署高精度检测,保护社交平台免受恶意机器人操纵。
- 社交机器人识别:从大规模账号行为中精确甄别机器人,减少人工审核负担。
- 在线社区治理:辅助平台治理僵尸粉、水军和垃圾信息,维护社区真实互动。
- 网络舆情监测:识别自动操纵舆论的机器人,为舆情分析提供更可靠的真实用户数据。