基于MapReduce的模糊K-means算法并行化研究
杨延庆
袁华兵
1.西安医学院信息技术处 西安 7100212.西安医学院信息技术处 西安 710021
摘要:模糊K-means算法是一种能够定量地确定事物亲属关系的软聚类算法,由于该算法在大规模数据的分析和处理中存在的不足,因此提出一种基于MapReduce模型的并行化实现.首先在Map函数的输出传递给其他节点的Reduce函数之前,改进Combine函数设计,增加本地中间结果处理,减少通信开销,以提高MapReduce任务计算速度.然后在Hadoop分布式计算平台上对多组规模不同的数据集进行测试.实验表明,基于MapReduce的并行模糊K-means算法适合大规模数据的分析和处理,而且执行速度提高了约1.9倍,聚类效果更为显著.
关键词:模糊K-meansMapReduce模型Combine函数Hadoop平台
分类号:TP301(计算技术、计算机技术)
资助基金:陕西省青年科学基金(71701160)教学改革研究项目(2018JG-07)
论文发表日期:2020-07-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 1564-1567,1765 )
英文信息
