跨数据集误差大降
通过自约束学习与重构任务压制语音内容干扰,让说话人嵌入更聚焦于说话人身份特征。
Hong, Qianbei · Wu, Chung-Hsien · Wang, Hsin-Min
IEEE/ACM Transactions on Audio Speech and Language Processing 2023
自约束学习减小帧级特征发散,重构任务进一步在帧级层消除语音信息,使嵌入更聚焦于说话人身份。
在VoxCeleb1上相比ECAPA-TDNN等错误率降低7.5%,验证集上的性能提升表明该架构能有效抑制语音内容对嵌入的干扰。