小数据追平CNN
通过卷积嵌入与动态通道调和,让视觉Transformer摆脱对海量数据的依赖,在小数据集上达到卷积网络的识别水平。
Zhiying, Lu · Liu, Chuanbin · Chang, Xiaojun · 张勇东 · 谢洪涛
IEEE Transactions on Pattern Analysis and Machine Intelligence 2025
卷积特征嵌入与特征投影模块引入归纳偏置,增强空间相关性,使ViT在小数据集上也能达到CNN水平。
动态聚合机制与“head token”设计重新校准并调和不同通道的表征,提升特征多样性。
采用最优多阶段混合结构并移除类别token,结合维度可变残差连接,在提升性能的同时降低计算开销。