多模态语义增强预测
融合蛋白质序列与疾病描述的多模态语义,以对比学习预训练提升基因-疾病关联预测的准确性。
梁上松 · Jani, Bhautesh Dinesh · Meng, Zaiqiao
Briefings in Bioinformatics 2024
融合蛋白质序列和疾病描述两种异构生物医学实体的语义,比单一序列或网络结构更能代表基因和疾病的功能。
采用预训练阶段利用对比学习损失在大规模公开GDA数据集上训练,提取潜在特征,缓解对标注训练数据的依赖。
在五个数据集上进行综合实验,并与五个竞争基线模型比较,证明模型有效性。