十亿序列同源搜索工具ERAST

比Foldseek快50倍

ERAST通过结合大语言模型、向量数据库和三级检索优化,在数十亿规模生物序列库中实现高精度、低延迟的核苷酸与蛋白质同源搜索,解决了现有工具在处理超大序列数据库时效率与准确性不足的问题。

He, Bing · Wu, Zihan · Wang, Fang · 赵宇 · Qin, Chenchen · 陈华钧 · 张强 · Yao, Jianhua

Nature Biotechnology 2026

参数信息

加速比(对比Foldseek)
50 ×
加速比(对比TM-align)
50000 ×
数据库规模
1 billion

技术优势

十亿规模可用

该工具基于目前最大的向量数据库,能处理约10亿条生物序列,打破先前工具的规模瓶颈。

毫秒级响应

凭借先进索引与三级检索优化,ERAST 能在数毫秒内完成对数十亿条序列的精确搜索,满足交互式场景的延迟要求。

双类型序列支持

同时支持核苷酸和蛋白质序列,避免了为不同类型序列部署多套工具的运维开销。

应用场景