零样本指称定位
利用CLIP建立的图像-文本共享特征空间,可对训练中未见过类别的目标进行指称理解,有效扩展REC的实际应用范围。
Jingcheng, Ke · Jia, Wang · Chen, Juncheng · Jhuo, I. Hong · Chia-Wen, Lin · Lin, Yenyu
IEEE Transactions on Multimedia 2023
利用CLIP的图文共享特征空间对齐物体图与类别标签图,使模型对训练中未出现的类别也能进行推理。
通过图协同注意力模块同时建模图像中物体间关系与类别标签间依赖,充分融合视觉和语言信息。
引入多层感知机将CLIP特征适配到语言解析器产生的表达表示上,提升了跨模态匹配效果。