低资源ASR提速
利用自监督学习语音单元拼接高资源语言语音片段,为低资源语言合成声学一致的训练数据,加速模型收敛并提升识别性能。
王伟 · 钱彦旻
IEEE/ACM Transactions on Audio Speech and Language Processing 2023
框架仅需高资源语言的语音片段和低资源语言的文本,通过自监督单元对齐,绕开了传统跨语言迁移中对平行语音或音素标注的依赖。
基于置信度的采样策略优先选择高质量片段,使 ASR 模型在训练早期就快速收敛,减少对大量迭代的依赖。
加入更大规模的无监督语音库作为片段来源,无需任何标注即可进一步提升性能,10% 的相对提升证明了框架的扩展性。