动作引导提示调谐网络

动作感知更准

通过扩展动作词信息并模拟人类事件分割,该网络提升了视频接地的跨模态匹配能力。

Jing, Wang · Raymon, Tsao · Xuan, Wang · 王小捷 · 冯方向 · Shiyu, Tian · Poria, Soujanya

Information Fusion 2025

技术优势

补足动词信息

通过提示探索模块扩展显著动词的潜在信息,减少语言特征稀疏性,从而促进跨模态匹配。

模拟人切分事件

引入动作时序预测辅助任务和时序排名损失,让模型像人一样感知事件边界。

即插即用

只增加极少参数就能集成到任何视频接地模型,无需大幅改动结构。

验证广泛

在三个骨干网络和三个数据集上的消融实验均表明方法有效。

应用场景