时域自适应注意网络

语音分离精度新高

该网络通过级联局部与全局注意力模块,自适应捕获语音信号中的细节特征与上下文关联,显著提升单通道语音分离性能。

王坤朋 · Hao, Zhou · Cai, Jingxiang · Wenna, Li · Yao, Juan

Eurasip Journal on Audio, Speech, and Music Processing 2023

参数信息

SI-SNRi
20.7 dB
SDRi
20.9 dB

技术优势

局部细节更清晰

通过通道和空间注意力让模型聚焦帧级特征,从而更好地保持语音的时频连续性和频谱结构。

全局上下文建模

利用自注意力机制探索语音上下文的全局关联,捕获句级特征。

分离性能领先

在 WSJ0-2mix 上取得 20.7 dB SI-SNRi 和 20.9 dB SDRi,优于其他端到端方法。

应用场景