增强细节表征
通过聚合图像的补丁表示,该模型强化了数据表征中的细节信息,使预训练的视觉Transformer在数据有限时也能获得更具判别力的表征,从而在图像分类、迁移学习和目标检测任务中取得优越表现。
Zhuomin, Liang · 白亮 · Jinyu, Fan · Yang, Xian · 梁吉业
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过额外的 ViT 对比模块聚合图像的 patch 表征,使模型关注局部细节,提升特征对相似样本的区分能力。
在多个数据集上,该模型的性能在图像分类、迁移学习和目标检测任务中均超过现有方法。