可变形多粒度融合网络

跨模态视频矩检索

该网络通过多尺度可变形注意力与对抗对比学习,实现视频与查询文本的精准跨模态对齐,提升视频语料矩检索精度。

Xuemei, Zhang · Peng, Zhao · Ji, Jinsheng · 卢宪凯 · Yin, Yinlong

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

对齐更准

通过多尺度可变形注意力分别对视频字幕和帧进行多粒度特征融合,并由查询引导生成自适应权重融合两种模态,增强跨模态表示。

定位更精

引入对抗对比学习目标,使得模型在双向注意力模块后获得的跨模态表示能够更精确地定位相关片段。

应用场景