动量跨模态对比网络

跨模态表征更精准

引入动量对比学习实现大规模负样本交互,并生成片段特定词嵌入以对齐视频与查询,从而更准确地定位视频中与文本描述相匹配的时刻。

De, Han · Xing, Cheng · Guo, Nan · 叶笑春 · Rainer, Benjamin · Priller, Peter

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

负样本更多样

通过动量队列引入大规模跨模态负样本,避免模型过拟合视频内样本偏差,从而学习到更鲁棒的跨模态表征。

词嵌入动态匹配

注意力模块根据每个视频片段生成特定的词嵌入,从时间维度对齐语义,有助于定位边界模糊的相关内容。

不挑视觉特征

在三个基准数据集上使用不同的视觉特征均取得最优结果,表明方法对输入特征具有较好的泛化性。

应用场景