Hadoop平台下实现文本分类的优化算法
潘俊辉
王辉
张强
王浩畅
东北石油大学 大庆 163318
摘要:目前如何对互联网上的海量数据进行文本分类已经成为一个重要的研究方向,随着云计算技术和Hadoop平台的逐步发展,文本分类的并行化方式将能够更有效的解决当前的问题.论文针对文本分类中特征选择阶段对文本分类性能有很大影响的缺点,提出了一种改进的特征选择算法——类别相关度算法(Class Correlation Algorithm,CCA),同时根据Hadoop平台在海量数据存储和处理方面所具有的优点,利用MapReduce的并行编程框架和HDFS分布式存储系统对文本分类的各个阶段实现了并行化编程.最后通过实验将Hadoop平台下的文本分类的优化算法与传统的单机运行环境下的文本分类算法进行了对比分析,实验结果表明对于相同的数据集,该算法在运算时间上有极大的提高.
关键词:Hadoop文本分类特征选择MapReduce
分类号:TP311(计算技术、计算机技术)
资助基金:国家自然科学基金(61702093)国家自然科学基金(2020QNL-02)
论文发表日期:2021-10-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 2043-2047 )
英文信息
