对象级跨模态对齐
把语言表达和图像区域在对象层面显式对齐,而不是在像素层面逐点匹配。
Jiajin, Tang · Ge, Zheng · Cheng, Shi · Yang, Sibei
2023
用查询令牌表示对象,通过查询语言特征和分组视觉特征实现对象感知的跨模态推理,而非像素级对齐。
每两个连续层中联合更新查询令牌和掩码,实现跨层交互,使模型能捕捉多尺度信息。
将对比学习与分组策略结合,用于识别与指代对象对应的令牌和掩码,提升指代分割的准确性。
在分割和泛化设置下均显著优于现有方法,表明模型在多种场景下都能有效工作。