小规模无数据蒸馏算法

训练效率提升百倍

在无需原始训练数据的前提下,通过极少量合成样本实现高效知识蒸馏,显著优于现有方法。

Liu, He · 王一开 · 刘华平 · 孙富春 · Yao, Anbang

2024

参数信息

训练效率提升
1-2 orders of magnitude

技术优势

训练快百倍

整体训练效率比许多主流方法快一到两个数量级,因为合成样本规模小,且动态缓冲区和优先级采样减少了无效计算。

性能不下降

即便样本量极少,SSD-KD 通过平衡类别分布和样本难度,仍能保持优越或有竞争力的模型性能。

应用场景