时序建模新范式
将音视频分割视为多变量时间序列建模任务,通过序列内时序注意力与序列间共享注意力图实现跨模态融合,在三个基准上取得最优性能。
Shen, Li · 王养柱 · Xuyi, Fan · Yuning, Wei · 邱华鑫
IEEE Transactions on Multimedia 2026
将帧序列和音频序列视为两条时间序列,通过时序注意力提取序列内特征,并通过共享时序注意力图实现跨模态交互,从而更有效地捕获和融合时空信息。
采用单流融合模块统一学习空间紧凑的视觉特征和非平凡的声学特征及其关系建模,避免了多流架构中的信息割裂,提升了融合效率。
在三个AVSBench数据集上进行了广泛实验,在分割和语义分割场景中均验证了最先进的性能,表明该框架在不同任务设置下具有优越性。