跨模态联合空间
针对视觉与语言信息密度差异,采用不对称掩蔽率与分层特征重建,为医学视觉问答、图像文本检索等下游任务提供统一的跨模态表征,实验证明其优于现有方法。
陈之宏 · Yuhao, Du · Jinpeng, Hu · 刘洋 · 李冠彬 · 万翔 · Tsung-Hui, Chang
Medical Image Analysis 2023
对图像使用更高的掩蔽率,对文本使用较低的掩蔽率,以匹配视觉与语言不同的信息密度,从而更好地学习联合表征。
利用视觉和文本不同层的特征进行重建,以应对视觉与语言抽象程度的不同,从而捕获更丰富的语义信息。
为视觉和语言分别设计不同的解码器结构,以更好地适应各自模态的特性。
在自建的医学视觉语言基准上,M³AE 在所有下游任务中均取得了当时最先进的结果。