视频文本跨模态预训练
通过视频与文本的多级语义匹配,实现端到端的跨模态预训练,提升文本视频检索精度。
Wenxue, Shen · Song J. · Zhu, Xiaosu · Gongfu, Li · 申恒涛
IEEE Transactions on Image Processing 2023
通过帧-文本匹配代理任务,模型利用视频帧与文本之间的语义连接,从而学到更细粒度的表示。
引入多模态动量对比框架,能够纳入更多负样本进行对比学习,提升表示的泛化性。
帧邻接匹配任务在从头训练时增强视觉表示,不依赖文本配对信息。