大规模数据可扩展
一种基于结构熵的半监督聚类方法,能够高效处理大规模数据集,并统一融合成对约束与标签约束,实现可解释的分区与层次聚类。
Zeng, Guangjie · 彭浩 · 李昂生 · Wu, Jia · Liu, Chunyang · Yu, Philip S.
IEEE Transactions on Knowledge and Data Engineering 2024
基于图采样的算法将时间和空间复杂度显著降低,使得聚类可以扩展到大规模数据集。
为成对约束和标签约束提供了统一的视角,使得不同来源的约束可以无缝集成。
基于结构熵设计的目标函数能够同时执行半监督分区和层次聚类,满足不同粒度需求。
相比深度学习方法,SSSE基于结构熵理论,聚类过程具有完全的可解释性。