超越主流方法
该框架模拟人类阅读理解行为,通过三级模块化设计实现更充分的跨模态交互,在三个基准数据集上均取得领先性能。
Di, Wang · Xiantao, Lu · Quan, Wang · 田玉敏 · 万波 · 何立火
IEEE Transactions on Multimedia 2024
通过三级模块逐级深化跨模态理解,从模态内上下文到片段-单词直接对应,再到候选时刻与查询的整体对应,避免单一匹配带来的信息丢失。
先分别把握视频和查询的主旨,再细粒度标记关键词直接对应,最后整合验证整体对应关系,模拟人类定位文档片段的自然行为。
引入双连通图卷积网络增强模块,在候选时刻表示中更好地融入查询信息,提升定位精度。