视频矩检索新SOTA
通过图编码器和细粒度跨模态交互,同时捕捉查询与视频的模态内及模态间关系,显著提升视频矩检索精度。
Zhao, Yibo · 高赞 · Ma, Chunjie · Guan, Weili · Riwei, Wang · Chen, Shengyong
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过语义图编码器和细粒度跨模态交互模块,捕捉查询、视频和候选片段内部及之间的深层关系。
在TACoS数据集上超越所有最新方法,并在Charades-STA和ActivityNet-Captions上取得可比结果。
自适应融合模块结合跨相似度加权和模态内加权,充分挖掘细粒度关系信息。