省参不减精度
通过扩-精-扩结构和共识梯度重置,在保持教师模型精度的同时大幅压缩学生模型。
Xie, Yi · Wu, Hanxiao · 朱建清 · 曾焕强 · 张婧
IEEE Transactions on Image Processing 2024
RER结构本身就能扩展学生表征能力,无需额外的特征维度适配器,避免了知识失真。
训练好的RER可以通过重参数化简化为一个紧凑的卷积层,加快推理速度。
在VeRi-776上以ResNet101为教师,节省75.33%模型参数和74.29% FLOPs,精度不下降。