两项新增强方法
提出TF-IDF词丢弃和自适应同义词替换,兼顾语义保持与样本多样性。
晁国清 · Jingyao, Liu · Mingyu, Wang · 初佃辉
Knowledge-Based Systems 2023
提出语义保持和多样性两个标准,可量化评估数据增强方法的好坏,指导方法选择。
两种新方法在实验中均有效,能增强情感分类模型对文本变体的鲁棒性。
总结了三条具体策略:采用在线增强、将词重要性纳入采样、根据模型状态过滤增强数据,可直接用于提高增强效果。