跨模态表征更精准
引入动量对比学习实现大规模负样本交互,并生成片段特定词嵌入以对齐视频与查询,从而更准确地定位视频中与文本描述相匹配的时刻。
De, Han · Xing, Cheng · Guo, Nan · 叶笑春 · Rainer, Benjamin · Priller, Peter
IEEE Transactions on Circuits and Systems for Video Technology 2023
通过动量队列引入大规模跨模态负样本,避免模型过拟合视频内样本偏差,从而学习到更鲁棒的跨模态表征。
注意力模块根据每个视频片段生成特定的词嵌入,从时间维度对齐语义,有助于定位边界模糊的相关内容。
在三个基准数据集上使用不同的视觉特征均取得最优结果,表明方法对输入特征具有较好的泛化性。