跨句上下文建模
MSStyleTTS通过全局、句子和子词三级风格建模,利用相邻句子的上下文信息,实现多句文本到自然表现力语音的合成,优于现有方法。
Lei, Shun · Zhou, Yixuan · 陈里洋 · 吴志勇 · Wu, Xixin · Kang, Shiyin · Meng, Helen Mei Ling
IEEE/ACM Transactions on Audio Speech and Language Processing 2023
风格预测器利用上下文中的结构关系,从全局、句子和子词级别探索层次化上下文信息,使生成语音在多句文本上更自然。
多尺度风格提取器从真实语音中提取多尺度风格嵌入,并显式指导风格预测,使模型能够更好地建模不同粒度的风格变化。
在域内和域外有声书数据集上的评估表明,该方法显著优于三个基线模型,显示出良好的泛化能力。