低数据阶段显著提升
一个集成到主动学习流程中的模块,能在采样前剔除冗余数据,让每个标注样本都带来有效增益,尤其提升低数据阶段的性能。
杨嘉琛 · Ma, Shukun · Zhang, Zhuo · 李阳 · Xiao, Shuai · Wen, Jiabao · Wen, Lu · 高新波
IEEE Transactions on Multimedia 2024
利用特征聚类和消除器计算数据相似度,剔除重叠度高的样本,避免重复标注相似数据。
在采样阶段采用 Outlier Feature Elimination 策略识别并重标注可疑样本,提高标注质量。
实验表明,在低数据阶段,该模块能显著提升现有主动学习算法的性能,具有通用性。