跨语言数据拼接框架

低资源ASR提速

利用自监督学习语音单元拼接高资源语言语音片段,为低资源语言合成声学一致的训练数据,加速模型收敛并提升识别性能。

王伟 · 钱彦旻

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

参数信息

相对提升
25-35 %
相对提升
20 %
额外相对提升
10 %

技术优势

不需要平行语料

框架仅需高资源语言的语音片段和低资源语言的文本,通过自监督单元对齐,绕开了传统跨语言迁移中对平行语音或音素标注的依赖。

更快收敛

基于置信度的采样策略优先选择高质量片段,使 ASR 模型在训练早期就快速收敛,减少对大量迭代的依赖。

可扩展到无标注语料

加入更大规模的无监督语音库作为片段来源,无需任何标注即可进一步提升性能,10% 的相对提升证明了框架的扩展性。

应用场景