免比对快预测
无需多序列比对,直接利用预训练蛋白质语言模型学习共进化信息,在精度接近主流方法的同时将预测时间缩短两个数量级。
Xiaomin, Fang · Wang, Fan · Liu, Lihang · Jingzhou, He · Dayong, Lin · Xiang, Yingfei · Kunrui, Zhu · Zhang, Xiaonan · Wu, Hua · Li, Hui · Song, Le
Nature Machine Intelligence 2023
模型完全省略了多序列比对搜索这一步,直接用序列预测结构,整个流程从几十分钟降到秒级甚至更快。
在 CASP14 和 CAMEO 数据集上,特别是同源序列较多的靶点上,HelixFold-Single 的预测精度与依赖多序列比对的主流方法相当。
预训练语言模型与 AlphaFold2 关键模块结合成一个端到端可微分模型,便于微调和迁移到下游任务。