超级视觉Transformer

多尺寸变计算量

同一模型可处理不同大小图像块并保留不同比例信息令牌,在降低计算量的同时保持甚至提升识别精度。

林明宝 · Mengzhao, Chen · Zhang, Yuxin · Chunhua, Shen · Rongrong, Ji · 曹刘娟

International Journal of Computer Vision 2023

参数信息

FLOPs缩减倍数
2 ×
Top-1准确率提升
0.2 %
FLOPs缩减倍数
1.5 ×
Top-1准确率提升
0.7 %
相对EViT的Top-1准确率提升
1.1 %

技术优势

多尺寸输入

同一个模型能处理不同大小的图像块,适应不同分辨率的输入,无需为每种输入尺寸单独训练或调整。

动态令牌保留

推理时可灵活选择保留多少比例的令牌,从而在准确率和计算开销之间实时权衡,适配可用的硬件资源。

越省越准

与 DeiT-S 基线相比,减少 2 倍 FLOPs 的同时 Top-1 准确率反而提升 0.2%,打破了降低计算量必然牺牲精度的预期。

显著优于同类高效ViT

在相同 FLOPs 下,以 DeiT-S 为骨干,比最新的 EViT 高出 1.1% 的 Top-1 准确率,表现出更强的效率-精度权衡。

应用场景