电商视频问答更准
面向真实电商场景的视听问答,在提取局部序列表示的同时学习全局多模态特征,并用对比约束强化音视频关联。
Linjun, Li · Tao, Jin · Wang, Lin · Hao, Jiang · Pan, Wenwen · Wang, Jian · Xiao, Shuwen · Yan, Xia · Weihao, Jiang · 赵洲
IEEE Transactions on Circuits and Systems for Video Technology 2023
引入了原始音频,与视觉特征进行多粒度交互,使模型能利用音视频互补信息回答问题。
在音视频特征交互后施加对比约束,强化两种模态之间的关联,从而提升问答性能。
通过设计高效的多粒度注意力机制,时间复杂度较基线降低约10%。