预训练DNA语言模型加速新类群整合
借助预训练DNA语言模型,PhyloTune能够自动选择序列中最具信息量的区域进行系统发育树更新,避免手动挑选分子标记,显著提升将新测序物种整合进现有系统发育树的效率。
Danruo, Deng · Comes, Hans Peter · 于锋 · Li, Pan · 张金仓 · Ann Heng, Pheng
Nature Communications 2025
PhyloTune利用预训练DNA语言模型自动判断序列中最具信息量的区域,无需人工挑选分子标记就能构建子树。
该方法通过识别新序列的分类单元并仅更新相应子树,加速将新物种纳入现有系统发育树的过程。
PhyloTune在模拟数据集以及自建的植物(Embryophyta)和微生物(Bordetella属)数据集上均得到验证。