选择性状态空间分割模型

线性复杂度音视频分割

用Mamba架构突破Transformer在长序列音视频分割中的计算瓶颈,实现精度与效率的同步提升。

Sitong, Gong · Zhuge, Yunzhi · 张路 · 王一凡 · 张平平 · 王立军 · 卢湖川

IEEE Transactions on Multimedia 2025

技术优势

算力开销大幅降低

采用Mamba的选择性状态空间模型,将长距离依赖建模的计算复杂度从Transformer的二次降为线性。

长序列处理更高效

模型中每个模块均以线性复杂度运行,处理长视频序列时资源占用更低,扩展性更好。

音视频特征深度融合

通过Vision-to-Audio融合块和语境整合金字塔,在帧级与时间级双向传递音视频信息,增强声源定位。

分割精度刷新纪录

在AVSBench-object和AVSBench-semantic两个基准上均取得新的state-of-the-art,证明方法的有效性。

应用场景