跨模态知识表示关系抽取网络

知识路径桥接语义鸿沟

该网络通过跨模态对象-实体对显式选择外部知识路径并扩展为知识图,利用图注意力捕获多粒度概念,为社交媒体文本关系抽取补充高层语义,缓解视觉与文本间的语义鸿沟。

Junhao, Feng · 王国华 · Zheng, Changmeng · 蔡毅 · Fu, Ze · Wang, Yaowei · 魏骁勇 · Li Q.

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

语义鸿沟被弥合

RECK 通过跨模态对象-实体对显式选择知识路径,而不是像以往方法那样训练所有模态的公共子空间,从而获得高层语义。

多粒度概念被捕获

将知识路径扩展为知识图谱,并采用图注意力网络来捕获多粒度的相关概念,为关系抽取提供更关键的高层语义信息。

多模态信息对齐融合

使用跨模态注意力机制对齐并融合多模态信息,使文本和视觉特征在统一语义空间中互补。

实现新的最优性能

在多模态关系抽取数据集上的实验结果表明,RECK 的性能超越了以往方法。

应用场景