基于Flink框架的K-means算法优化及并行计算策略
李召鑫
孟祥印
肖世德
胡锴沣
赖焕杰
西南交通大学机械工程学院 成都 610031
摘要:K-means算法因其原理简单和聚类效果尚佳的优点在机器学习和数据挖掘领域得到广泛使用,但其仍存在一些缺点:K-means算法需指定分类类别数K;K-means算法对于初始聚类中心的选取策略是随机选择,这可能会影响到最终聚类结果的准确率及计算速度.以上缺点都限制了K-means算法的计算效率的进一步提升.论文针对以上问题,提出了一种基于Flink并行化的K-means优化算法,该算法在传统K-means算法的基础上引入Canopy算法来完成初始聚类,得到类别数K,然后采用最大距离算法来计算初始聚类中心,并利用Flink框架的并行计算能力,对多个数据集进行聚类实验.实验结果表明,论文算法可以减少聚类过程迭代次数,并且在聚类准确率方面也有一定的提高,在大规模数据集环境下同样具有良好的计算效率.
关键词:FlinkK-means算法Canopy算法并行化
分类号:TP301.6(计算技术、计算机技术)
论文发表日期:2023-10-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 2231-2235 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2023,51(10)
所属栏目:算法与分析