三级类人视频时刻检索框架

超越主流方法

该框架模拟人类阅读理解行为,通过三级模块化设计实现更充分的跨模态交互,在三个基准数据集上均取得领先性能。

Di, Wang · Xiantao, Lu · Quan, Wang · 田玉敏 · 万波 · 何立火

IEEE Transactions on Multimedia 2024

参数信息

基准数据集数量
3
组成模块数
3

技术优势

交互更充分

通过三级模块逐级深化跨模态理解,从模态内上下文到片段-单词直接对应,再到候选时刻与查询的整体对应,避免单一匹配带来的信息丢失。

三步递进

先分别把握视频和查询的主旨,再细粒度标记关键词直接对应,最后整合验证整体对应关系,模拟人类定位文档片段的自然行为。

优化查询表示

引入双连通图卷积网络增强模块,在候选时刻表示中更好地融入查询信息,提升定位精度。

应用场景