音素感知分层增强框架

低资源粤语识别提效

通过音素替换与语义掩码的组合增强,在无额外标注数据的情况下显著提升粤语语音识别的准确性。

Lusheng, Zhang · 吴世娥 · 王中训

Sensors 2025

参数信息

字符错误率
16.88 %
字符错误率
4.27 %
字符错误率
2.32 %
相对提升
32-44 %

技术优势

错误率大幅下降

通过音素替换和语义掩码的组合,模型在公开粤语数据集上的字符错误率相对降低32-44%,且不依赖额外标注。

无标注也能增强

框架利用预训练模型的对齐和合成技术生成音素变体,仅使用现有标注数据即可扩充发音多样性,降低了数据采集成本。

掩码更聪明

利用wav2vec 2.0的注意力热图和关键词边界定位信息丰富的时频区域,并通过强化学习动态调整掩码策略,促使模型利用更广泛的上下文。

换模型也有效

增强方案在wav2vec 2.0和Zipformer两种不同结构的模型上均带来显著提升,证明其与模型架构无关。

应用场景