小样本视频检索
把冻结的图像语言CLIP模型扩展出视频时序能力,在四个主流基准上取得SOTA,且训练数据量远小于现有方法。
Fang, Han · Xiong, Pengfei · Luhui, Xu · Luo, Wenhan
IEEE Transactions on Multimedia 2023
通过利用预训练的图像-语言模型,方法对大规模视频-文本数据集的依赖降低,在较小数据集上也能有效学习。
引入时序差分块(TDB),在细粒度视频帧间捕捉运动信息,增强对动态内容的建模。
时序对齐块(TAB)重新对齐视频片段与文本短语的token,增强跨模态相关性,提升检索精度。