语音信息分解的说话人嵌入网络

跨数据集误差大降

通过自约束学习与重构任务压制语音内容干扰,让说话人嵌入更聚焦于说话人身份特征。

Hong, Qianbei · Wu, Chung-Hsien · Wang, Hsin-Min

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

参数信息

等错误率降低(VoxCeleb1)
7.5 %
等错误率降低(SITW)
3.4 %
等错误率降低(Librispeech清洁语音)
25.5 %
等错误率降低(VoxMovies)
7.9 %

技术优势

内容剔除更彻底

自约束学习减小帧级特征发散,重构任务进一步在帧级层消除语音信息,使嵌入更聚焦于说话人身份。

等错误率下降

在VoxCeleb1上相比ECAPA-TDNN等错误率降低7.5%,验证集上的性能提升表明该架构能有效抑制语音内容对嵌入的干扰。

应用场景