感知对齐更优
通过特征融合与结构相似性损失,提升语音去混响的感知质量。
Bajian, Xiang · 毛文宇 · Tan, Kaijun · 鲁华祥
IEEE Signal Processing Letters 2024
训练目标从传统误差指标换成结构相似性,直接对齐语音的感知质量,而非仅仅降低数值误差。
在7项常用指标中,模型在6项上超过现有最强模型,可作为语音去混响的新参照。
通道注意力、时频注意力与空洞卷积块的组合,使低层细节与高层语义得到有效整合。