本发明提出了一种基于Spark和ASPSO的并行化K‑means的优化方法,包括以下步骤:S1,通过分割函数粗略的划分数据集,并利用网格划分策略PCCV来计算数据网格的皮尔逊相关系数与相关系数阈值,再对数据网格进行划分,获取网格单元;S2,采用SPFG策略,对数据点进行局部区域覆盖,更新数据集中的样本点,形成区域簇,获取局部聚类的簇数;S3,采用ASPSO策略,计算自适应参数,获取局部簇质心;S4,采用CRNN策略计算每个簇的簇半径,并根据簇的相似性函数进行相似度判断,结合Spark并行计算框架将相似度大的簇进行合并;S5,输出聚类结果。本发明在运行效率和聚类精确度上都有显著的提高,此外通过该方法所挖掘出的知识,能够在生物学,医学,天文地理学上提供巨大的帮助。
📄 2021105016684
📂 G06K9_62
👤 江西理工大学
📅 2021-05-08