跨模态检索图像字幕模型

检索增强理解

借鉴人类认知过程,通过检索相关上下文记忆并利用双注意力解码,缓解对象幻觉,实现更全面的场景理解。

Cao, Shan · 安高云 · 岑翼刚 · Zhaoqilin, Yang · Lin, Weisi

Pattern Recognition 2024

参数信息

训练数据量(低资源场景)
0.1 %
训练数据量(低资源场景)
0.5 %
训练数据量(低资源场景)
1 %

技术优势

缓解对象幻觉

双注意力解码器通过重新加权图像和文本特征进行视觉条件化,减少模型生成图像中不存在的对象。

低资源有效

模型即使在仅使用 0.1%、0.5% 和 1% 的 MS COCO 训练数据时仍表现良好,适合标注数据稀缺的场景。

场景理解全面

通过图像-文本检索器获取相关句子作为情景记忆,并利用自注意力和相关性注意力丰富记忆,使模型能够更彻底地理解场景。

应用场景