动作感知更准
通过扩展动作词信息并模拟人类事件分割,该网络提升了视频接地的跨模态匹配能力。
Jing, Wang · Raymon, Tsao · Xuan, Wang · 王小捷 · 冯方向 · Shiyu, Tian · Poria, Soujanya
Information Fusion 2025
通过提示探索模块扩展显著动词的潜在信息,减少语言特征稀疏性,从而促进跨模态匹配。
引入动作时序预测辅助任务和时序排名损失,让模型像人一样感知事件边界。
只增加极少参数就能集成到任何视频接地模型,无需大幅改动结构。
在三个骨干网络和三个数据集上的消融实验均表明方法有效。