掩码语言统一处理
将视觉掩码与语言指代映射到同尺寸标记,用单个自注意力模型统一处理两种视频对象分割任务,并通过强化学习优化滤波器突出目标信息。
Sun, Mingjie · 肖继民 · Lim, Enggee · 赵才荣 · 赵耀
IEEE Transactions on Circuits and Systems for Video Technology 2023
视觉掩码和语言指代被映射为同尺寸标记,由同一个自注意力模型处理,开发者和用户不再需要为两种模态维护两套方案。
滤波器通过强化学习优化,能够突出目标信息并丢弃非目标或模糊信息,使分割更聚焦。