多模态对齐更精准
该网络通过问题引导的外观-运动与位置-语义双分支交互,在视频问答中更完整地建模对象间关系,超越现有方法。
王征 · Li, Fangtao · Ota, Kaoru · Dong, Mianxiong · 吴斌
Information Processing and Management 2023
通过问题引导的外观-运动模块捕获外观与运动特征之间的相互依赖,更准确地表征视频内容。
利用构建的多关系图注意力网络捕获对象间的几何位置和语义交互,捕捉更丰富的视觉对象关系。
问题驱动的多视觉融合模块整合来自两个分支的信息,获得更准确的多模态表示。
在三个基准数据集上的大量实验表明,该框架优于现有最先进方法。