一种为参考视频对象分割设计的视觉增强语言特征编码模块,通过早期融合视觉提示,为下游分割提供更具判别力的查询特征。
Qiqi, Gao · 钟宛君 · 李杰 · 赵铁军
2023
视觉提示由关键帧视觉特征经与文本的对齐分数调制而成,与文本输入拼接后编码,使查询直接编码目标外观。
在编码早期便引入视觉提示,而非仅在解码后期与视觉特征交互,可让语言编码携带视觉上下文。
在Refer-Youtube-VOS基准上比此前最优方法高出2.3分,证明该编码方式能带来可观的性能增益。