免注释手语翻译
一种无需中间注释的端到端手语翻译模型,通过自适应掩码与局部自注意力增强视频表示,在多个数据集上取得有竞争力的结果。
Zidong, Liu · 伍家松 · Shen, Zeyu · 陈新 · Wu, Qianyu · Gui, Zhiguo · Senhadji, Lotfi · Shu, Huazhong
IEEE Transactions on Circuits and Systems for Video Technology 2024
模型不依赖任何中间注释(gloss)标注,直接学习视频到句子的映射,省去了繁重的注释对齐工作。
在 CSL-FocusOn、PHOENIX14T 和 CSL-Daily 三个数据集上均进行了实验,证明方法的通用性。
通过自适应掩码(AM)、局部片段自注意力(LCSA)和自适应融合(AF)三个模块增强视频表示,提升翻译性能。