早期损失误标检测框架

训练中顺带纠错

利用训练初期损失先识别并移除误标样本,再用伪标签与二分类模型处理剩余不确定样本,提升检测精度与自动化程度。

73863095 · 柴成亮 · Cao, Lei · Tang, Nan · Wang, Jiayi · 范举 · 袁野 · 王国仁

Proceedings of the VLDB Endowment 2024

参数信息

检测性能提升(优势数据集数量)
15
数据集数量
15
基线方法数量
10

技术优势

训练早期就能筛出误标

利用模型在训练早期的损失观察,在模型过拟合误标样本之前识别并移除它们。

自动判断何时停止

当早期损失不再能有效检测误标时,框架会自动终止迭代检测过程,避免多余的计算。

不确定的样本也能处理

对于仍不确定的样本,自动生成伪标签并训练二分类模型,利用模型的泛化能力判断其真实标签。

应用场景