隐式跨模态对齐
将纯文本查询转化为包含图像与文字标记的多模态提示,通过提示感知注意力和对比学习实现更一致的跨模态表示,从而提升多模态命名实体识别性能。
Bao, Xi Gang · Mengyuan, Tian · Zhiyuan, Zha · 覃飙
2023
将图像视为视觉对象集合会引入偏差,本方法通过隐式对齐避免这种偏差,直接利用多模态提示进行融合。
设计提示感知注意力机制,更好地整合图像标记与文本标记,提升跨模态融合效果。
使用两种对比损失进行对比学习,学习更一致的双模态表示并降低噪声。