蛋白语言模型

免比对快预测

无需多序列比对,直接利用预训练蛋白质语言模型学习共进化信息,在精度接近主流方法的同时将预测时间缩短两个数量级。

Xiaomin, Fang · Wang, Fan · Liu, Lihang · Jingzhou, He · Dayong, Lin · Xiang, Yingfei · Kunrui, Zhu · Zhang, Xiaonan · Wu, Hua · Li, Hui · Song, Le

Nature Machine Intelligence 2023

参数信息

预测时间缩短倍数
100 ×

技术优势

最快可快两个数量级

模型完全省略了多序列比对搜索这一步,直接用序列预测结构,整个流程从几十分钟降到秒级甚至更快。

精度接近主流方法

在 CASP14 和 CAMEO 数据集上,特别是同源序列较多的靶点上,HelixFold-Single 的预测精度与依赖多序列比对的主流方法相当。

端到端可微分

预训练语言模型与 AlphaFold2 关键模块结合成一个端到端可微分模型,便于微调和迁移到下游任务。

应用场景