深度融合Transformer图像字幕模型

多模态深度融合

通过全局交叉编码与层次化交叉注意力,在编码到解码全过程中实现视觉与语义特征的深度融合,显著提升图像字幕生成质量。

Zhang, Jing · Yingshuai, Xie · 丁炜超 · 王喆

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

层次化跨模态推理

解码器中的交叉注意力实现多级视觉与语义特征交互,增强复杂跨模态推理能力。

性能超越现有方法

在 MS COCO 数据集上达到优秀性能,超越现有最优方法。

应用场景