双数据集涨点3%+
用问题引导局部特征提取与全局-局部融合,在音视频问答中实现更精准的多模态理解。
Chen, Zailong · Wang, Lei · Wang, Peng · Peng, Gao
IEEE Transactions on Circuits and Systems for Video Technology 2023
问题不仅引导局部特征提取,还指导全局与局部特征的最终融合,从而更有效地利用与问题相关的信息。
在全局和局部两个层级上刻画音视频场景,并在每个层级内充分融合多模态特征,兼顾整体语境与细节信息。
在MUSIC-AVQA和AVQA数据集上分别取得3.3%和3.1%的平均绝对提升,超越现有方法。