多模态统一Transformer诊断模型

统一处理多模态输入

该模型通过统一处理放射影像、主诉和临床信息,学习整体表示,在肺病识别和COVID-19不良结局预测上优于图像专用及非统一多模态模型。

Hong-Yu, Zhou · 俞益洲 · 王成弟 · Zhang, Shu · Gao, Yuanxu · 潘佳 · Shao, Jun · 卢光明 · Zhang Kang · 李为民

Nature Biomedical Engineering 2023

参数信息

肺病识别准确率提升
12% %
肺病识别准确率提升
9% %
COVID-19不良结局预测提升
29% %
COVID-19不良结局预测提升
7% %

技术优势

统一处理多模态

将图像和非结构化、结构化文本转换为视觉标记和文本标记,通过模态内和模态间注意力学习整体表示,无需为每种模态设计单独的特征提取器。

诊断更准

在肺病识别上比仅用图像模型高出12%,比非统一多模态模型高出9%,表明融合多模态信息能显著提升诊断性能。

预后预测更优

在预测COVID-19患者不良临床结局上,比图像专用和非统一多模态模型分别高出29%和7%,有助于及时识别高危患者。

应用场景