一次性语音转换系统

自然的跨说话人转换

利用自监督预训练表示与梯度反转层,无需平行数据即可将源语音转换为目标说话人音色的系统。

黄浩 · Lin, Wang · 杨继臣 · 胡英 · 何亮

Eurasip Journal on Audio, Speech, and Music Processing 2023

参数信息

客观MCD
8.901
语音自然度主观MOS
4.45
说话人相似度主观MOS
3.62

技术优势

说话人信息更纯净

通过梯度反转层训练的说话人分类器,内容编码器可有效去除说话人信息,使内容表示更纯净。

重建特征更一致

从WavLM表示重建声学特征,与内容编码器输入保持一致,减少信息丢失。

转换性能全面提升

客观MCD、语音自然度和说话人相似度均优于基线,说明系统转换效果更好。

应用场景