伪标注免人工
将实体定位与动作定位统一为同一软监督任务,模型无需昂贵的人工标注即可在无定位标注的数据集上训练,显著提升视频描述准确性。
姜文晖 · Linxin, Liu · 方玉明 · Yibo, Cheng · Peng, Yu-Xin · Liu, Yang
IEEE Transactions on Circuits and Systems for Video Technology 2024
模型训练不再需要人工定位标注,因为定位目标由自动生成的伪标注来监督,这使得模型可以直接应用于没有任何定位标注的数据集。
网络包含实体定位和动作定位两个模块,并统一为一个软监督任务:实体定位使注意力集中在信息丰富的空间区域,动作定位则将动词与相关主体及其上下文动态关联,保留细粒度时空细节。
在 MSR-VTT、MSVD 和 ActivityNet-Entities 三个基准上分别比现有最优方法提升了 +2.4、+4.7 和 +5.1 CIDEr。