十二模型普适提升
通过超图建模视频-语言的高阶交互,自动挖掘并筛选高质量辅助时刻-查询对,无需额外人工标注即能显著提升多类视频时刻检索模型的性能。
曾润浩 · Yishen, Zhuo · Jialiang, Li · Yunjin, Yang · 吴惠思 · 陈奇 · 胡希平 · 梁中明
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过超图神经网络聚合节点信息并更新超边,利用节点相关性筛选出高质量的时刻-查询对,无需人工判断。
利用时刻内外语义匹配差异构造损失函数训练超图神经网络,整个过程不依赖人工标注。
辅助数据在三个数据集上、三种监督设定下一致提升了十二个模型的性能。