泛化硬样本
利用多教师知识蒸馏,将大规模无监督数据中的知识迁移到学生网络,提升中文攻击性语言检测器在困难样本和跨域场景下的泛化性与鲁棒性。
Jiawen, Deng · Sun, Hao · Zhexin, Zhang · Nakagawa, Satoshi · 任福继 · 黄民烈
Research 2023
通过数据爬取和模型生成构建包含100万样本的AugCOLD,缓解中文训练数据不足的问题。
利用多个教师模型为无监督数据分配软标签,将知识有效迁移到学生网络,提升性能。
在专门设计的困难测试上,多教师蒸馏模型展现出更强的泛化和抗干扰能力。