互文本视觉精化网络

对齐更精准

通过文本上下文增强与图像语义消歧,修正图文匹配中由信息缺失和语义模糊导致的错误对齐。

庞善民 · Yueyang, Zeng · Jiawei, Zhao · Jianru, Xue

IEEE Transactions on Multimedia 2024

技术优势

减少错误对齐

通过为文本补充视觉几何上下文并消除图像语义歧义,模型可以捕获最大化的相关关系,从而减少语义相同但实际错误的区域-词对齐。

融合多层次相似度

在匹配阶段同时利用局部和全局相似度,能够捕获视觉与语言之间的粗粒度和细粒度交互,从而更全面地度量图文相关性。

基准测试表现优异

在Flickr30K和MS-COCO两个广泛使用的图文匹配基准上,大量实验证明TVRN优于现有方法。

应用场景