多模态深度融合
通过全局交叉编码与层次化交叉注意力,在编码到解码全过程中实现视觉与语义特征的深度融合,显著提升图像字幕生成质量。
Zhang, Jing · Yingshuai, Xie · 丁炜超 · 王喆
IEEE Transactions on Circuits and Systems for Video Technology 2023
解码器中的交叉注意力实现多级视觉与语义特征交互,增强复杂跨模态推理能力。
在 MS COCO 数据集上达到优秀性能,超越现有最优方法。