统一多模态分割网络

掩码语言统一处理

将视觉掩码与语言指代映射到同尺寸标记,用单个自注意力模型统一处理两种视频对象分割任务,并通过强化学习优化滤波器突出目标信息。

Sun, Mingjie · 肖继民 · Lim, Enggee · 赵才荣 · 赵耀

IEEE Transactions on Circuits and Systems for Video Technology 2023

参数信息

Ref-YoutubeVOS J F
52.8 %
YoutubeVOS JS
83.2 %

技术优势

一个模型两用

视觉掩码和语言指代被映射为同尺寸标记,由同一个自注意力模型处理,开发者和用户不再需要为两种模态维护两套方案。

强化学习筛目标

滤波器通过强化学习优化,能够突出目标信息并丢弃非目标或模糊信息,使分割更聚焦。

应用场景