快速密度峰值聚类算法

大规模高维数据提速

通过近似k最近邻和三点聚类加速密度峰值聚类,在保持聚类质量的同时显著缩短运行时间。

Shifei, Ding · Li, Chao · 徐晓 · 郭丽丽 · Ding, Ling · Wu, Xindong

IEEE Transactions on Knowledge and Data Engineering 2025

技术优势

大规模数据跑得快

利用分层k均值构建近似k最近邻,避免对所有点对距离计算,显著降低时间消耗。

边界点也能找对邻居

三点聚类改善分区边界点的邻域搜索,避免硬划分造成的邻居丢失。

聚类中心更准

通过相似密度链在搜索聚类中心时标记连通的高密度点,提升中心识别的有效性。

应用场景