分级匹配视频检索模型

视频文本跨模态预训练

通过视频与文本的多级语义匹配,实现端到端的跨模态预训练,提升文本视频检索精度。

Wenxue, Shen · Song J. · Zhu, Xiaosu · Gongfu, Li · 申恒涛

IEEE Transactions on Image Processing 2023

技术优势

挖掘帧级语义

通过帧-文本匹配代理任务,模型利用视频帧与文本之间的语义连接,从而学到更细粒度的表示。

负样本更充分

引入多模态动量对比框架,能够纳入更多负样本进行对比学习,提升表示的泛化性。

单模态也增强

帧邻接匹配任务在从头训练时增强视觉表示,不依赖文本配对信息。

应用场景