知识路径桥接语义鸿沟
该网络通过跨模态对象-实体对显式选择外部知识路径并扩展为知识图,利用图注意力捕获多粒度概念,为社交媒体文本关系抽取补充高层语义,缓解视觉与文本间的语义鸿沟。
Junhao, Feng · 王国华 · Zheng, Changmeng · 蔡毅 · Fu, Ze · Wang, Yaowei · 魏骁勇 · Li Q.
IEEE Transactions on Circuits and Systems for Video Technology 2023
RECK 通过跨模态对象-实体对显式选择知识路径,而不是像以往方法那样训练所有模态的公共子空间,从而获得高层语义。
将知识路径扩展为知识图谱,并采用图注意力网络来捕获多粒度的相关概念,为关系抽取提供更关键的高层语义信息。
使用跨模态注意力机制对齐并融合多模态信息,使文本和视觉特征在统一语义空间中互补。
在多模态关系抽取数据集上的实验结果表明,RECK 的性能超越了以往方法。