多尺度风格语音合成模型

跨句上下文建模

MSStyleTTS通过全局、句子和子词三级风格建模,利用相邻句子的上下文信息,实现多句文本到自然表现力语音的合成,优于现有方法。

Lei, Shun · Zhou, Yixuan · 陈里洋 · 吴志勇 · Wu, Xixin · Kang, Shiyin · Meng, Helen Mei Ling

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

参数信息

风格建模层级
3
基线模型数量
3

技术优势

跨句上下文建模

风格预测器利用上下文中的结构关系,从全局、句子和子词级别探索层次化上下文信息,使生成语音在多句文本上更自然。

多尺度风格捕获

多尺度风格提取器从真实语音中提取多尺度风格嵌入,并显式指导风格预测,使模型能够更好地建模不同粒度的风格变化。

域内外均有效

在域内和域外有声书数据集上的评估表明,该方法显著优于三个基线模型,显示出良好的泛化能力。

应用场景