弱监督视频表征
通过查询与文本的相互标定,该网络双向消除监督噪声,为弱监督视频表征学习提供更可靠的语义对齐。
Long, Fuchen · Yao, Ting · Qiu, Zhaofan · 田新梅 · Jiebo, Luo · Mei, Tao
International Journal of Computer Vision 2023
查询与文本相互标定,同时修正查询多义性和文本同构性带来的错误对应,使训练信号更可靠。
在YOVO-10M上预训练并在Kinetics-400上微调后,top-1准确率比ImageNet预训练的TAda2D方法提高1.3%。
在YOVO-3M上训练的视频特征无需微调,仅用线性分类器即可在动作识别上取得优异成绩,证明特征具有良好的迁移性。
新收集的YOVO-3M和YOVO-10M数据集包含百万级视频及其查询和标题,为弱监督视频学习提供资源。