低资源识别领先
通过将离散语音单元量化器的码本信息注入交叉注意力,该模型无需修改预训练语言模型结构即可弥合语音与文本的模态差异,在跨语言和低资源场景下显著优于直接微调嵌入的方法。
79586880 · Lee, Hung Yi · Wang, Hsin-Min
IEEE Access 2026
该方法在跨语言设置下相比微调基线有明显提升,说明它不依赖特定语言的音素映射。
在数据量有限的低资源条件下仍能保持优势,减少对大规模标注语音的依赖。