弱监督视频定位
与现有使用随机掩码的方法不同,该网络通过分别处理名词和动词,使视频定位更符合人类大脑的语言解析机制。
Kefan, Tang · 何立火 · 王楠楠 · 高新波
IEEE Transactions on Multimedia 2024
分别提取对象感知和运动感知特征,用名词重建对象提议、用动词重建运动提议,模拟人脑解析机制。
强制对象提议和运动提议的边界高度一致,提高定位精度。
通过对比学习区分正负实例,增强模型对相关片段的辨别能力。