关系感知图推理网络

多模态对齐更精准

该网络通过问题引导的外观-运动与位置-语义双分支交互,在视频问答中更完整地建模对象间关系,超越现有方法。

王征 · Li, Fangtao · Ota, Kaoru · Dong, Mianxiong · 吴斌

Information Processing and Management 2023

技术优势

建模外观运动交互

通过问题引导的外观-运动模块捕获外观与运动特征之间的相互依赖,更准确地表征视频内容。

融入位置语义关系

利用构建的多关系图注意力网络捕获对象间的几何位置和语义交互,捕捉更丰富的视觉对象关系。

融合多视觉信息

问题驱动的多视觉融合模块整合来自两个分支的信息,获得更准确的多模态表示。

超越现有最先进模型

在三个基准数据集上的大量实验表明,该框架优于现有最先进方法。

应用场景