基于Spark平台的分类算法性能比较分析
赵蕾
夏吉安
吴洋
崔辉
南京工业职业技术大学计算机与软件学院 南京 210023
摘要:针对目前大数据与机器学习技术的快速发展,使用基于Spark平台的MLlib机器学习库实现前馈神经网络(Feedforward Artificial Neural Network)、支持向量机(Support Vector Machine)与随机森林(Random Forest)三种机器学习算法,并分析与评估三种算法在大数据平台下的运行与分类性能.实验结果表明,随着节点数的增加,三种算法在大数据平台上消耗的时间都逐步变少.当数据集小于100MB时神经网络与支持向量机算法加速比较高,数据集大于1GB时随机森林算法加速比优于其他两种算法.神经网络算法在数据集100MB时可扩展性最小,支持向量机算法在数据集500MB时可扩展性最小.随机森林算法在数据集大于1GB时规模增长性优于其他两种算法.通过对于三种分类算法的时间效率与准确性比较,支持向量机算法消耗的时间最少,但是分类准确性最低.神经网络算法消耗的时间最长,分类准确性低于随机森林算法.随机森林算法的分类准确性最高,但是算法运行时间高于支持向量机算法.集成分类算法在大数据平台上表现出较好的时间性能与分类准确性.
关键词:大数据Hadoop框架Spark框架机器学习性能评估
分类号:TP39(计算技术、计算机技术)S3(农学(农艺学))
资助基金:中国高校产学研创新基金(2020HYB02005)江苏省产学研合作项目(BY2022560)江苏省工业软件工程技术研究项目(ZK20-04-12)
论文发表日期:2024-03-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 688-691,704 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2024,52(3)
所属栏目:算法与分析