动态混合视觉Transformer

小数据追平CNN

通过卷积嵌入与动态通道调和,让视觉Transformer摆脱对海量数据的依赖,在小数据集上达到卷积网络的识别水平。

Zhiying, Lu · Liu, Chuanbin · Chang, Xiaojun · 张勇东 · 谢洪涛

IEEE Transactions on Pattern Analysis and Machine Intelligence 2025

参数信息

图像识别精度(CIFAR-10)
99.10 %

技术优势

小数据不再拖后腿

卷积特征嵌入与特征投影模块引入归纳偏置,增强空间相关性,使ViT在小数据集上也能达到CNN水平。

通道表征不再打架

动态聚合机制与“head token”设计重新校准并调和不同通道的表征,提升特征多样性。

算得更少,效果更好

采用最优多阶段混合结构并移除类别token,结合维度可变残差连接,在提升性能的同时降低计算开销。

应用场景