多粒度关系注意网络

电商视频问答更准

面向真实电商场景的视听问答,在提取局部序列表示的同时学习全局多模态特征,并用对比约束强化音视频关联。

Linjun, Li · Tao, Jin · Wang, Lin · Hao, Jiang · Pan, Wenwen · Wang, Jian · Xiao, Shuwen · Yan, Xia · Weihao, Jiang · 赵洲

IEEE Transactions on Circuits and Systems for Video Technology 2023

参数信息

WUPS@0.0
20.73 %
BLEU@1
19.81 %

技术优势

音频不再缺席

引入了原始音频,与视觉特征进行多粒度交互,使模型能利用音视频互补信息回答问题。

关联更紧

在音视频特征交互后施加对比约束,强化两种模态之间的关联,从而提升问答性能。

更快了

通过设计高效的多粒度注意力机制,时间复杂度较基线降低约10%。

应用场景