时序差分CLIP

小样本视频检索

把冻结的图像语言CLIP模型扩展出视频时序能力,在四个主流基准上取得SOTA,且训练数据量远小于现有方法。

Fang, Han · Xiong, Pengfei · Luhui, Xu · Luo, Wenhan

IEEE Transactions on Multimedia 2023

技术优势

小数据也能训

通过利用预训练的图像-语言模型,方法对大规模视频-文本数据集的依赖降低,在较小数据集上也能有效学习。

帧间运动可捕捉

引入时序差分块(TDB),在细粒度视频帧间捕捉运动信息,增强对动态内容的建模。

跨模态对齐更好

时序对齐块(TAB)重新对齐视频片段与文本短语的token,增强跨模态相关性,提升检索精度。

应用场景