上下文感知紧凑Transformer

VQA与VG新SOTA

一种通过文本全局上下文和空间上下文增强视觉语言依赖建模能力而达到多基准SOTA的Transformer模型。

Chen, Chongqing · 韩德志 · Chang, Chinchen

Pattern Recognition 2024

参数信息

VQA-v2准确率
73.71 %
CLEVR准确率
99.15 %

技术优势

抓住长距依赖

通过文本全局上下文的注入,语言编码器可以更准确地计算token间依赖关系,直接提升需要推理的任务表现。

跨模态对齐更强

空间上下文与文本全局上下文协同调制图像特征,使语言序列与图像序列信息对齐更合理,推理能力进一步增强。

多基准登顶

在五个VQA和VG基准数据集上取得新SOTA,其中VQA-v2达73.71%,CLEVR达99.15%。

应用场景