VTBR语义预训练模型

少样本预训练

一种通过密集文本描述学习视觉表征的语义预训练方法,在人员重识别任务中实现了与ImageNet预训练相当的性能,同时所需的图像数量显著减少。

Xiang, Suncheng · 钱大宏 · Jingsheng, Gao · Zhang, Zirui · 刘婷 · 付宇卓

ACM Transactions on Multimedia Computing, Communications and Applications 2023

参数信息

图像使用量减少
1.4 ×

技术优势

图像需求大减

用文本描述替代大规模图像预训练,达到相同性能时所用图像数量比 ImageNet 预训练少 1.4 倍。

绕开领域鸿沟

直接用行人相关的文本描述学习视觉表征,避免从通用图像到行人领域的迁移损失。

纯语义预训练

仅使用文本描述(FineGPR-C 数据集)训练 CNN,无需任何图像即可获得可迁移到下游 Re-ID 任务的视觉表征。

应用场景