视觉语言预训练模型

小数据高性能

通过图像填充与文本填充两个新任务实现细粒度多模态交互,大幅减少预训练数据需求。

程航 · Hehui, Ye · 周晓飞 · 74102781 · 陈菲 · 王美清

Pattern Recognition 2024

技术优势

数据需求小

通过模态交互任务,模型在更小的数据集上即可达到SOTA,降低数据采集成本。

交互更充分

图像填充与文本填充任务利用另一模态信息补全缺失部分,细粒度增强多模态融合。

语义冗余低

选择器机制最小化模态间语义重叠,提升预训练效率与效果。

应用场景