大序列高效挖掘
通过仅含关键点的图模型和并行计算,显著降低内存占用并加速多最长公共子序列挖掘。
李雁妮 · Liu, Bing · Tihua, Duan · Wang, Zhi · 李辉 · 崔江涛
IEEE Transactions on Knowledge and Data Engineering 2024
MLCS-DAG 中只保留关键点(key points),删除不贡献于解的非关键点,使图模型规模大幅缩小,解决大序列下的内存爆炸问题。
算法可有效挖掘长度≥10,000 的序列,克服了现有方法因图模型过大而无法处理大序列的瓶颈。
在合成与真实生物序列的广泛实验上,KP-MLCS 在效率和效果上均大幅超越现有最先进 MLCS 算法。