图文语义对齐更强
借助预训练多模态模型中的语言知识,为图像区域特征自动注入丰富一致的文本语义,提升图像描述生成的多样性与准确性。
Li, Jingyu · Zhang, Lei · 张坤 · Hu, Bo · 谢洪涛 · Mao, Zhengdong
IEEE Transactions on Circuits and Systems for Video Technology 2023
通过将对象语义提示与区域特征对齐,缓解了检测器数字标签与视觉特征之间的语义不一致问题。
在 nocaps 数据集上展现出优越的零样本性能,表明模型能描述训练中未见过的对象类别。