DBM视频时空模块

线性复杂度不输Transformer

通过参数共享双向通路与分离输入投影,增强视频时序建模,使状态空间模型在12项视频理解任务上可媲美Transformer。

Guo, Chen · Huang, Yifei · Xu, Jilan · Baoqi, Pei · Jiahao, Wang · Zhe, Chen · Zhiqi, Li · 路通 · 王利民

International Journal of Computer Vision 2026

参数信息

任务数
12
参与评测的SSM模型数
14

技术优势

算力不再爆表

状态空间模型以线性复杂度处理序列,模型参数量与计算量不会随着视频长度增加而急剧膨胀,适合长视频和高帧率场景。

时序建模更顺

DBM 用参数共享的双向通路和分离输入投影,克服了现有双向扫描的局限,增强时序建模能力,带来一致的性能提升。

多任务都能打

在时间定位、动作分割、视频字幕和多模态检索等 12 项任务上,Mamba 模型普遍达到或超过 Transformer 表现,证明其跨任务通用性。

应用场景