跨模态语义对齐
通过辅助图像描述对齐视觉与问题模态,增强融合前语义一致性,提升VQA推理可靠性。
王博岳 · Yujian, Ma · Xiaoyan, Li · Junbin, Gao · 胡永利 · 尹宝才
IEEE Transactions on Neural Networks and Learning Systems 2024
通过图像描述桥接问题与视觉,分别对齐后再融合,从而更准确地匹配关键视觉内容。
利用视觉-描述对语义关联比问题-视觉对更强的特点,采用对比学习增强单模态编码器的语义对齐能力。