多模态掩蔽自编码器

跨模态联合空间

针对视觉与语言信息密度差异,采用不对称掩蔽率与分层特征重建,为医学视觉问答、图像文本检索等下游任务提供统一的跨模态表征,实验证明其优于现有方法。

陈之宏 · Yuhao, Du · Jinpeng, Hu · 刘洋 · 李冠彬 · 万翔 · Tsung-Hui, Chang

Medical Image Analysis 2023

技术优势

针对信息密度差异掩蔽

对图像使用更高的掩蔽率,对文本使用较低的掩蔽率,以匹配视觉与语言不同的信息密度,从而更好地学习联合表征。

分层特征重建

利用视觉和文本不同层的特征进行重建,以应对视觉与语言抽象程度的不同,从而捕获更丰富的语义信息。

专用解码器设计

为视觉和语言分别设计不同的解码器结构,以更好地适应各自模态的特性。

下游任务达到最先进

在自建的医学视觉语言基准上,M³AE 在所有下游任务中均取得了当时最先进的结果。

应用场景