多尺寸变计算量
同一模型可处理不同大小图像块并保留不同比例信息令牌,在降低计算量的同时保持甚至提升识别精度。
林明宝 · Mengzhao, Chen · Zhang, Yuxin · Chunhua, Shen · Rongrong, Ji · 曹刘娟
International Journal of Computer Vision 2023
同一个模型能处理不同大小的图像块,适应不同分辨率的输入,无需为每种输入尺寸单独训练或调整。
推理时可灵活选择保留多少比例的令牌,从而在准确率和计算开销之间实时权衡,适配可用的硬件资源。
与 DeiT-S 基线相比,减少 2 倍 FLOPs 的同时 Top-1 准确率反而提升 0.2%,打破了降低计算量必然牺牲精度的预期。
在相同 FLOPs 下,以 DeiT-S 为骨干,比最新的 EViT 高出 1.1% 的 Top-1 准确率,表现出更强的效率-精度权衡。