视觉语义引导MRC框架

该框架将多图像的文本相关视觉特征聚合并映射为文本空间中的启发式提示,引导机器阅读理解,以提升多模态命名实体识别的跨模态交互与理解能力。

Jiapei, Hu · Lyu, Yifan · 薛云

Knowledge-Based Systems 2025

技术优势

聚焦相关视觉

文本引导的视觉聚合器从所有图像中同时提取与文本相关的视觉语义,并通过文本内容迭代细化,减少了冗余或不相关视觉信息的干扰。

提示式融合

通过专用的嵌入空间和重建机制,将视觉语义准确映射到文本空间,实现连贯的跨模态对齐,并将对齐后的视觉表示与文本表示拼接形成协同输入序列。

训练有监督

加入图像-文本匹配模块预测图像与文本的配对关系,监督聚合器和重建器的训练,进一步提升视觉表示的质量。

应用场景