自适应视频增强转换器

免注释手语翻译

一种无需中间注释的端到端手语翻译模型,通过自适应掩码与局部自注意力增强视频表示,在多个数据集上取得有竞争力的结果。

Zidong, Liu · 伍家松 · Shen, Zeyu · 陈新 · Wu, Qianyu · Gui, Zhiguo · Senhadji, Lotfi · Shu, Huazhong

IEEE Transactions on Circuits and Systems for Video Technology 2024

技术优势

免注释训练

模型不依赖任何中间注释(gloss)标注,直接学习视频到句子的映射,省去了繁重的注释对齐工作。

多数据集验证

在 CSL-FocusOn、PHOENIX14T 和 CSL-Daily 三个数据集上均进行了实验,证明方法的通用性。

模块化增强

通过自适应掩码(AM)、局部片段自注意力(LCSA)和自适应融合(AF)三个模块增强视频表示,提升翻译性能。

应用场景