语音情感识别更准
该网络结合Transformer,可同时捕获语音信号中多尺度时间与频率特征,实现语音情感识别性能提升。
Yan, Tianhao · 孟浩 · Parada-Cabaleiro, Emilia · Jianhua, Tao · 李太豪 · Schuller, Björn W.
IEEE Transactions on Affective Computing 2024
残差多尺度卷积结构能捕获不同时间尺度的语音情感特征,弥补单一尺度卷积的不足,从而提升识别性能。
Transformer结构结合频谱维度位置信息,克服了传统Transformer仅编码时域的问题,能够有效获取频域判别特征的位置,提升情感识别准确性。
模型代码已在GitHub公开,研究者可以直接复现或在其基础上进一步开发,降低了使用门槛。