多域指标全面领先
双音频流与LLM文本增强通过非对称融合对齐情感特征,解决文本主导问题,在三个数据集上均优于现有基线。
张丽英 · Tianbo, Zou · Lumeng, Chen · 王智广 · Li, Chengyang · 郑馨竺
Computer Speech and Language 2027
利用大语言模型进行文本多样化,并结合可控语音合成技术生成了多风格语音,构建了增强数据集 CH-SIMS v2.0-DA。
音频分支采用双流架构,wav2vec 2.0 从原始波形捕获音素级语义依赖,MHSA-BiLSTM 分析 MFCC 频谱-时间模式以建模韵律细节。
基于 Transformer 的非对称融合模块以文本为查询引导对声学键值的注意力,动态平衡模态贡献。