低资源粤语识别提效
通过音素替换与语义掩码的组合增强,在无额外标注数据的情况下显著提升粤语语音识别的准确性。
Lusheng, Zhang · 吴世娥 · 王中训
Sensors 2025
通过音素替换和语义掩码的组合,模型在公开粤语数据集上的字符错误率相对降低32-44%,且不依赖额外标注。
框架利用预训练模型的对齐和合成技术生成音素变体,仅使用现有标注数据即可扩充发音多样性,降低了数据采集成本。
利用wav2vec 2.0的注意力热图和关键词边界定位信息丰富的时频区域,并通过强化学习动态调整掩码策略,促使模型利用更广泛的上下文。
增强方案在wav2vec 2.0和Zipformer两种不同结构的模型上均带来显著提升,证明其与模型架构无关。