自然的跨说话人转换
利用自监督预训练表示与梯度反转层,无需平行数据即可将源语音转换为目标说话人音色的系统。
黄浩 · Lin, Wang · 杨继臣 · 胡英 · 何亮
Eurasip Journal on Audio, Speech, and Music Processing 2023
通过梯度反转层训练的说话人分类器,内容编码器可有效去除说话人信息,使内容表示更纯净。
从WavLM表示重建声学特征,与内容编码器输入保持一致,减少信息丢失。
客观MCD、语音自然度和说话人相似度均优于基线,说明系统转换效果更好。