对比自监督VQA模型

抗语言偏差

该方案通过对比学习与自监督辅助任务克服语言先验,显著增强视觉问答模型在分布外场景下的鲁棒性。

Runlin, Cao · 李志欣 · Tang, Zhen Jun · Canlong, Zhang · 马慧芳

Pattern Recognition 2025

参数信息

VQA-CP v2 精度
62.30 %

技术优势

消除语言偏差

通过对比学习和自监督辅助任务平衡有偏数据,使模型不过度依赖语言先验。

无需额外标注

训练过程中不需要任何额外的人工标注,降低了数据准备成本。

兼容多种骨干

可应用于不同的 VQA 骨干网络,便于集成到现有系统中。

应用场景