视觉与文本深度融合
通过手语注释作为中间桥梁,克服模型对手语视频翻译中文本问题的过度依赖,实现视觉与文本信息的均衡利用。
Gao, Liqing · Lyu, Fan · Peng, Shi · Zhu, Lei · Pu, Junfu · 万亮 · 冯伟
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过将视觉特征转换为文本形式的手语注释,模型在生成翻译时能够平衡利用问题和视觉信息,而不是过度依赖问题文本。
通过跨模态对比学习策略,增强了问题与手语视频在全局上下文和局部语义上的对齐,使翻译更准确。
在提出的 QSL 数据集和其他公开手语数据集上进行了大量实验,结果表明该方法比现有 SLT 方法有显著提升。