高重叠下性能更优
针对重叠语音场景,通过串行输出训练策略,在重叠率较高时仍能保持稳定的识别准确率。
李涛 · Lingyan, Huang · 王峰 · Li, Song · 洪青阳 · 李琳
Communications in Computer and Information Science 2023
通过串行输出训练,即使重叠率达到0.5,识别性能仍优于基线。
在不同重叠率混合的数据集上,平均CER相对降低4.9%,不是只对特定工况有效。
通过把重叠语音建模为串行输出序列,使单通道系统也能有效处理多人同时说话。