音视频分割模型AVSAC

强化音频引导分割

通过双向音视频解码器和帧级同步策略,缓解模态不平衡,提升音视频联合表征学习。

Tianxiang, Chen · Zhentao, Tan · Gong, Tao · Chu, Qi · Wu, Yue · 刘斌 · Yu, Neng-Hai · Lu, Le · Ye, Jieping

IEEE Transactions on Circuits and Systems for Video Technology 2024

技术优势

强化音频引导

双向桥接增强了音频线索,使音频在特征融合中占据更大比重,从而提升分割精度。

无需额外标注

帧级同步策略作为细粒度引导,仅利用现有音视频对即可训练,不依赖额外的人工标注。

SOTA性能

在多个公开AVS基准上达到领先水平,可直接对比现有方法。

应用场景