音色归一化VQ特征TTS

少样本高相似合成

用音色归一化矢量量化特征将说话风格与音色分离,少样本适配时能同时精细模仿目标说话人的音色和风格,超越现有说话人嵌入和微调基线方法。

Du, Chenpeng · Guo, Yiwei · Chen, Xie · 俞凯

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

技术优势

风格也能模仿

通过音色归一化VQ特征,将说话风格与音色分解,让声学模型和声码器分别控制,从而仅用少量数据就能同时模仿目标说话人的音色和风格。

说话人相似度更高

在LibriTTS上的适配实验中,本方法的说话人相似度优于基于说话人嵌入的适配方法和微调基线AdaSpeech,更适合少样本场景。

自然度几乎不损失

引入音色归一化和k-means量化后,重构性能和自然度几乎保持不变,说明特征处理没有牺牲合成质量。

应用场景