残差多尺度卷积网络

语音情感识别更准

该网络结合Transformer,可同时捕获语音信号中多尺度时间与频率特征,实现语音情感识别性能提升。

Yan, Tianhao · 孟浩 · Parada-Cabaleiro, Emilia · Jianhua, Tao · 李太豪 · Schuller, Björn W.

IEEE Transactions on Affective Computing 2024

参数信息

预测维度
3

技术优势

多尺度特征提取

残差多尺度卷积结构能捕获不同时间尺度的语音情感特征,弥补单一尺度卷积的不足,从而提升识别性能。

时频联合建模

Transformer结构结合频谱维度位置信息,克服了传统Transformer仅编码时域的问题,能够有效获取频域判别特征的位置,提升情感识别准确性。

端到端可复现

模型代码已在GitHub公开,研究者可以直接复现或在其基础上进一步开发,降低了使用门槛。

应用场景