Gloss-Bridged 手语翻译器

视觉与文本深度融合

通过手语注释作为中间桥梁,克服模型对手语视频翻译中文本问题的过度依赖,实现视觉与文本信息的均衡利用。

Gao, Liqing · Lyu, Fan · Peng, Shi · Zhu, Lei · Pu, Junfu · 万亮 · 冯伟

IEEE Transactions on Circuits and Systems for Video Technology 2024

技术优势

减少对问题的依赖

通过将视觉特征转换为文本形式的手语注释,模型在生成翻译时能够平衡利用问题和视觉信息,而不是过度依赖问题文本。

提升语义对齐

通过跨模态对比学习策略,增强了问题与手语视频在全局上下文和局部语义上的对齐,使翻译更准确。

多个数据集验证有效

在提出的 QSL 数据集和其他公开手语数据集上进行了大量实验,结果表明该方法比现有 SLT 方法有显著提升。

应用场景