双分支手语识别模型

视频内外相关性协同

突破单分支网络仅学习视频内相关性的局限,通过双分支结构显式建模视频内与视频间的相关性,增强视觉特征泛化性。

Jingze, Liu · 薛万利 · Yuan, Tiantian · Chen, Shengyong

Information Fusion 2024

技术优势

视频间相关性显式建模

引入基于对比学习的视频间相关性模块,通过设计视频间和视频内损失共同优化两个分支的视觉特征,提升泛化能力。

自适应建立词-片段映射

提出基于词引导注意力的特征生成器,自适应构建词与视频片段间的映射,从而在单个视频内获取初步的词引导视觉特征。

应用场景