跨模态对齐细节增强
利用预训练CLIP和两个辅助任务,强化视觉细节理解,解决身份混淆,显著提升跨模态检索精度。
Wei, Shen · Ming, Fang · Wang, Yuxia · Jiafeng, Xiao · Diping, Li · Huangqun, Chen · Ling, Xu · Zhang, Weifeng
Knowledge-Based Systems 2025
通过构建文本引导的掩码图像建模任务,模型无需显式标注即可学习局部视觉细节。
设计身份监督的全局视觉特征校准任务,引导模型学习身份感知的全局视觉特征,从而缓解身份混淆。
辅助任务均不依赖显式标注,利用预训练CLIP中嵌入的知识即可完成适应。