训练效率提升百倍
在无需原始训练数据的前提下,通过极少量合成样本实现高效知识蒸馏,显著优于现有方法。
Liu, He · 王一开 · 刘华平 · 孙富春 · Yao, Anbang
2024
整体训练效率比许多主流方法快一到两个数量级,因为合成样本规模小,且动态缓冲区和优先级采样减少了无效计算。
即便样本量极少,SSD-KD 通过平衡类别分布和样本难度,仍能保持优越或有竞争力的模型性能。