双向知识蒸馏DDDG

F1提升8.69%

结合生成式自监督预训练的双向知识蒸馏方法,不仅提升学生模型性能,还能反向增强教师模型,并在异构SoC上实现4.09倍加速。

Huaicheng, Zhang · 刘文翰 · Guo, Qianxi · Shi, Jiguang · 常胜 · 王豪 · 何进 · 黄启俊

Expert Systems with Applications 2024

参数信息

学生网络F1分数提升
8.69 %
学生网络F1分数提升
9.26 %
教师模型F1分数提升
4.82 %
教师模型F1分数提升
8.33 %
相对最优算法F1提升
5.25 %
相对最优算法F1提升
2.06 %
SoC加速比
4.09 times

技术优势

学生明显变强

通过特征与响应双向蒸馏,学生网络F1分数提升8.69%和9.26%。

教师也被增强

双向蒸馏机制让教师模型从学生反馈中获益,F1分数提升4.82%和8.33%。

部署快四倍

在异构SoC上采用ARM+FPGA协同加速,比纯软件部署快4.09倍,适合便携设备。

自监督降成本

利用无标签数据进行生成式自监督预训练,减少对人工标注的依赖。

应用场景