线性复杂度音视频分割
用Mamba架构突破Transformer在长序列音视频分割中的计算瓶颈,实现精度与效率的同步提升。
Sitong, Gong · Zhuge, Yunzhi · 张路 · 王一凡 · 张平平 · 王立军 · 卢湖川
IEEE Transactions on Multimedia 2025
采用Mamba的选择性状态空间模型,将长距离依赖建模的计算复杂度从Transformer的二次降为线性。
模型中每个模块均以线性复杂度运行,处理长视频序列时资源占用更低,扩展性更好。
通过Vision-to-Audio融合块和语境整合金字塔,在帧级与时间级双向传递音视频信息,增强声源定位。
在AVSBench-object和AVSBench-semantic两个基准上均取得新的state-of-the-art,证明方法的有效性。