轻量视觉Transformer

蒸馏预训练

通过掩码图像建模蒸馏预训练,解决轻量级ViT高层表示学习不足的问题,在数据稀缺的下游任务上显著提升迁移性能。

高晋 · Shubo, Lin · Wang, Shaoru · Kou, Yutong · Li, Zeming · Li, Liang · 张聪炫 · 张笑钦 · 王以政 · 胡卫明

International Journal of Computer Vision 2025

参数信息

top-1准确率
79.4 %
top-1准确率
78.9 %
mIoU
42.8 %
AUC
66.1 %

技术优势

高层学好不再难

通过蒸馏策略解决MIM预训练在高层表示学习上的不足,提升迁移性能。

少量数据也能迁移

在数据不充足的下游任务上,经蒸馏预训练的模型也能获得良好迁移效果。

轻量模型SOTA表现

在ImageNet-1K、ADE20K和LaSOT上取得轻量级模型中的顶尖表现,其中LaSOT AUC超越现有SOTA轻量级CPU实时跟踪器。

应用场景