Hadoop下并行化实现文本聚类的优化算法
王辉1
潘俊辉1
Marius.Petrescu2
王浩畅1
张强1
1.东北石油大学计算机与信息技术学院 大庆 1633182.普罗莱斯蒂石油天然气大学 什蒂 100680
摘要:目前对文本进行聚类分析是数据挖掘领域的一个重要研究方向,传统的K-means聚类算法在处理海量数据时存在初始聚类中心选取随意而导致运行不稳定的缺点.针对该缺点以及单机串行编程对海量数据聚类效率低的问题,提出了一种Hadoop平台下并行化实现文本聚类的优化算法.该算法首先使用向量空间模型对文本进行表示,并对该过程基于MapReduce并行处理,接着采用基于密度和最大最小距离的算法对初始聚类中心的选取进行优化,并将该优化应用到K-means算法,然后基于MapReduce实现对文本的并行聚类.最后通过实验将Hadoop平台下并行化实现文本聚类的优化算法与其他聚类算法进行对比,实验结果表明优化的文本聚类并行算法在聚类效率和聚类质量上均有较大的提高.
关键词:K-means文本聚类向量空间模型MapReduce
分类号:TP311(计算技术、计算机技术)
资助基金:国家自然科学基金(61402099)国家自然科学基金(61702093)黑龙江省自然科学基金项目(2018003)东北石油大学引导性创新基金项目(2020YDL-18)
论文发表日期:2022-12-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2611-2615,2664 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2022,50(12)
所属栏目:算法与分析