双层视觉定位网络

伪标注免人工

将实体定位与动作定位统一为同一软监督任务,模型无需昂贵的人工标注即可在无定位标注的数据集上训练,显著提升视频描述准确性。

姜文晖 · Linxin, Liu · 方玉明 · Yibo, Cheng · Peng, Yu-Xin · Liu, Yang

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

CIDEr 提升(MSR-VTT)
+2.4
CIDEr 提升(MSVD)
+4.7
CIDEr 提升(ActivityNet-Entities)
+5.1

技术优势

免人工标注

模型训练不再需要人工定位标注,因为定位目标由自动生成的伪标注来监督,这使得模型可以直接应用于没有任何定位标注的数据集。

同时定位实体与动作

网络包含实体定位和动作定位两个模块,并统一为一个软监督任务:实体定位使注意力集中在信息丰富的空间区域,动作定位则将动词与相关主体及其上下文动态关联,保留细粒度时空细节。

三个基准上显著提升

在 MSR-VTT、MSVD 和 ActivityNet-Entities 三个基准上分别比现有最优方法提升了 +2.4、+4.7 和 +5.1 CIDEr。

应用场景