串行输出训练语音识别模型

高重叠下性能更优

针对重叠语音场景,通过串行输出训练策略,在重叠率较高时仍能保持稳定的识别准确率。

李涛 · Lingyan, Huang · 王峰 · Li, Song · 洪青阳 · 李琳

Communications in Computer and Information Science 2023

参数信息

相对CER提升(重叠率0.5)
10.8 %
平均相对CER提升
4.9 %

技术优势

高重叠下不掉链子

通过串行输出训练,即使重叠率达到0.5,识别性能仍优于基线。

全场景都能提升

在不同重叠率混合的数据集上,平均CER相对降低4.9%,不是只对特定工况有效。

让重叠不再是难题

通过把重叠语音建模为串行输出序列,使单通道系统也能有效处理多人同时说话。

应用场景