比Foldseek快50倍
ERAST通过结合大语言模型、向量数据库和三级检索优化,在数十亿规模生物序列库中实现高精度、低延迟的核苷酸与蛋白质同源搜索,解决了现有工具在处理超大序列数据库时效率与准确性不足的问题。
He, Bing · Wu, Zihan · Wang, Fang · 赵宇 · Qin, Chenchen · 陈华钧 · 张强 · Yao, Jianhua
Nature Biotechnology 2026
该工具基于目前最大的向量数据库,能处理约10亿条生物序列,打破先前工具的规模瓶颈。
凭借先进索引与三级检索优化,ERAST 能在数毫秒内完成对数十亿条序列的精确搜索,满足交互式场景的延迟要求。
同时支持核苷酸和蛋白质序列,避免了为不同类型序列部署多套工具的运维开销。