多特征解耦抗噪语音转换模型

抗噪强、自然度高

采用三个独立编码器分别提取内容、说话人身份和音高,并通过对抗训练与梯度反转层提取抗噪表示,在噪声环境下保持语音自然度与说话人相似度。

Chen, Lele · Xiongwei, Zhang · Li, Yihao · Sun, Meng

Engineering Applications of Artificial Intelligence 2024

参数信息

语音自然度提升
0.31
说话人相似度提升
0.39

技术优势

音高也解耦

使用三个独立编码器分别处理内容、说话人身份和音高,通过最小化互信息减少特征向量之间的相关性,从而提升解耦性能。

抗噪表示提取

引入梯度反转层和噪声解耦判别器,通过对抗训练提取抗噪的说话人和内容表示,从而合成高质量语音。

训练更易收敛

采用干净和噪声数据交替训练的策略,有效引导并加速模型收敛。

应用场景