无推理速度损失
将教师模型的定位知识高效迁移至学生模型,首次证明logit模仿可超越特征模仿。
郑兆晖 · Ye, Rongguang · 侯淇彬 · 任冬伟 · 王萍 · 左旺孟 · 程明明
IEEE Transactions on Pattern Analysis and Machine Intelligence 2023
将定位知识从教师模型高效传递给学生模型,解决logit模仿中定位信息丢失的问题。
首次证明logit模仿可超越特征模仿,关键在于蒸馏有价值的定位区域。
蒸馏方案在提升精度的同时完全不影响推理速度。