统一处理多模态输入
该模型通过统一处理放射影像、主诉和临床信息,学习整体表示,在肺病识别和COVID-19不良结局预测上优于图像专用及非统一多模态模型。
Hong-Yu, Zhou · 俞益洲 · 王成弟 · Zhang, Shu · Gao, Yuanxu · 潘佳 · Shao, Jun · 卢光明 · Zhang Kang · 李为民
Nature Biomedical Engineering 2023
将图像和非结构化、结构化文本转换为视觉标记和文本标记,通过模态内和模态间注意力学习整体表示,无需为每种模态设计单独的特征提取器。
在肺病识别上比仅用图像模型高出12%,比非统一多模态模型高出9%,表明融合多模态信息能显著提升诊断性能。
在预测COVID-19患者不良临床结局上,比图像专用和非统一多模态模型分别高出29%和7%,有助于及时识别高危患者。