区域可定制声音提取模型

指定区域只留目标声

面向多通道区域声音提取任务,把带分裂RNN扩展到多通道,可按角度窗、球、锥等任意几何区域提取目标声源。

Gu, Rongzhi · Luo, Yi

IEEE/ACM Transactions on Audio Speech and Language Processing 2024

技术优势

区域任意可定义

用户可以用角度窗、球、锥等几何图形定义目标区域,不再局限于预设的固定区域。

多类型区域提取

框架包含了不同类型空间区域的定义方法,能够提取所有活跃目标声源。

多通道扩展

对带分裂RNN模型进行了多通道扩展,专门用于区域声音提取任务。

实验全面

针对不同麦克风阵列几何、区域类型和系统配置进行了消融研究,并在模拟和真实数据上验证。

应用场景