跨模态引导视觉表示

社交图像检索精度提升

利用跨模态交互从噪声标签中提取精确视觉语义,用于社交图像的单模态检索。

管子玉 · 赵万青 · 刘红敏 · Nakashima, Yuta · Babaguchi, Noboru · 何晓飞

IEEE Transactions on Pattern Analysis and Machine Intelligence 2024

参数信息

MAP提升(基准1)
8.82
MAP提升(基准2)
5.45

技术优势

噪声标签也能用

通过将标签间常识关系嵌入注意力计算,模型能联合感知文本和视觉上下文,从噪声中提取准确语义。

可做单模态检索

通过精心设计的训练策略,将跨模态学到的精确表示能力迁移到仅图像哈希子网络,部署时无需标签输入。

精度提升显著

在两个广泛使用的社交图像基准上,MAP 比现有最佳方法分别提升约 8.82 和 5.45 个百分点。

应用场景