CLIP增强行人检索模型

跨模态对齐细节增强

利用预训练CLIP和两个辅助任务,强化视觉细节理解,解决身份混淆,显著提升跨模态检索精度。

Wei, Shen · Ming, Fang · Wang, Yuxia · Jiafeng, Xiao · Diping, Li · Huangqun, Chen · Ling, Xu · Zhang, Weifeng

Knowledge-Based Systems 2025

参数信息

Rank-1准确率提升幅度
1%–9%

技术优势

视觉细节增强

通过构建文本引导的掩码图像建模任务,模型无需显式标注即可学习局部视觉细节。

身份感知校准

设计身份监督的全局视觉特征校准任务,引导模型学习身份感知的全局视觉特征,从而缓解身份混淆。

无标注训练

辅助任务均不依赖显式标注,利用预训练CLIP中嵌入的知识即可完成适应。

应用场景