语音分离精度新高
该网络通过级联局部与全局注意力模块,自适应捕获语音信号中的细节特征与上下文关联,显著提升单通道语音分离性能。
王坤朋 · Hao, Zhou · Cai, Jingxiang · Wenna, Li · Yao, Juan
Eurasip Journal on Audio, Speech, and Music Processing 2023
通过通道和空间注意力让模型聚焦帧级特征,从而更好地保持语音的时频连续性和频谱结构。
利用自注意力机制探索语音上下文的全局关联,捕获句级特征。
在 WSJ0-2mix 上取得 20.7 dB SI-SNRi 和 20.9 dB SDRi,优于其他端到端方法。