社交图像检索精度提升
利用跨模态交互从噪声标签中提取精确视觉语义,用于社交图像的单模态检索。
管子玉 · 赵万青 · 刘红敏 · Nakashima, Yuta · Babaguchi, Noboru · 何晓飞
IEEE Transactions on Pattern Analysis and Machine Intelligence 2024
通过将标签间常识关系嵌入注意力计算,模型能联合感知文本和视觉上下文,从噪声中提取准确语义。
通过精心设计的训练策略,将跨模态学到的精确表示能力迁移到仅图像哈希子网络,部署时无需标签输入。
在两个广泛使用的社交图像基准上,MAP 比现有最佳方法分别提升约 8.82 和 5.45 个百分点。