细粒度模态关系感知网络

视频矩检索新SOTA

通过图编码器和细粒度跨模态交互,同时捕捉查询与视频的模态内及模态间关系,显著提升视频矩检索精度。

Zhao, Yibo · 高赞 · Ma, Chunjie · Guan, Weili · Riwei, Wang · Chen, Shengyong

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

平均提升(相比MCMN)
3.61 %
平均提升(相比DPHANet)
5 %

技术优势

模态关系建模更细

通过语义图编码器和细粒度跨模态交互模块,捕捉查询、视频和候选片段内部及之间的深层关系。

TACoS上超越现有方法

在TACoS数据集上超越所有最新方法,并在Charades-STA和ActivityNet-Captions上取得可比结果。

跨模态融合更精准

自适应融合模块结合跨相似度加权和模态内加权,充分挖掘细粒度关系信息。

应用场景