级联语义提示对齐网络

图文语义对齐更强

借助预训练多模态模型中的语言知识,为图像区域特征自动注入丰富一致的文本语义,提升图像描述生成的多样性与准确性。

Li, Jingyu · Zhang, Lei · 张坤 · Hu, Bo · 谢洪涛 · Mao, Zhengdong

IEEE Transactions on Circuits and Systems for Video Technology 2023

参数信息

CIDEr
145.2 %
CIDEr
141.6 %
CIDEr
144.1 %
RefCLIP-S
83.2

技术优势

语义一致

通过将对象语义提示与区域特征对齐,缓解了检测器数字标签与视觉特征之间的语义不一致问题。

零样本泛化

在 nocaps 数据集上展现出优越的零样本性能,表明模型能描述训练中未见过的对象类别。

应用场景