多语种精度领先
通过注意力增强的空间-时间特征提取器和数量比课程学习策略,在多种低资源语言的唇读基准上达到最高精度。
Megiyanto Rahmatullah, Griffani · Ruan, Shanq Jang · Li, Lieber Po Hung
Neurocomputing 2025
通过在土耳其语、罗马尼亚语、德语和印度尼西亚语等低资源语言数据集上的基准测试,验证了模型在这些语言上都能达到当前最佳精度,填补了低资源语言唇读的研究空白。
引入了通道与空间注意力增强的ResNet-18和结合BiGRU与多级残差Transformer编码器的空间-时间特征提取器,能更精确地捕捉唇部运动特征,从而提高识别精度。
采用数量比课程学习策略,从简单类别开始逐步引入更难样本,同时保持对简单样本的持续接触,使得训练过程更稳定,最终模型性能更好。