VQA与VG新SOTA
一种通过文本全局上下文和空间上下文增强视觉语言依赖建模能力而达到多基准SOTA的Transformer模型。
Chen, Chongqing · 韩德志 · Chang, Chinchen
Pattern Recognition 2024
通过文本全局上下文的注入,语言编码器可以更准确地计算token间依赖关系,直接提升需要推理的任务表现。
空间上下文与文本全局上下文协同调制图像特征,使语言序列与图像序列信息对齐更合理,推理能力进一步增强。
在五个VQA和VG基准数据集上取得新SOTA,其中VQA-v2达73.71%,CLEVR达99.15%。