可扩展稀疏变换器
旋律提取轻量化
用稀疏注意力在保持旋律提取精度的同时大幅降低计算量,适合在资源受限的设备上部署。
于帅 · Jun, Liu · Yu, Yi · 李巍
2024
技术优势
计算量大幅降低
采用稀疏注意力机制,减少自注意力的计算区域,从而降低计算成本和参数量。
全局局部特征融合
结合稀疏Transformer和CNN,分别提取全局和局部特征,并利用Transformer-CNN融合模块有效整合两类特征。
部署更可行
相比标准Transformer,该模型在计算效率和参数量上更适合实际部署,尤其是边缘设备。
应用场景
- 音乐信息检索:为MIR系统提供轻量化旋律提取模块,降低计算资源需求,便于在服务端或移动端部署。
- 歌声旋律提取:在保持提取精度的同时减少计算量,使得旋律提取能够应用于实时或资源受限的场景。
- 边缘端音频处理:模型参数量和计算量小,适合在边缘设备上进行音频信号处理,实现本地化的旋律分析。
- 高效深度学习:通过稀疏注意力和模型融合,在保证性能的同时提升计算效率,为高效深度学习模型设计提供参考。