基于Spark平台的离群数据并行挖掘算法
李俊丽
晋中学院信息技术与工程学院 晋中 030619
摘要:大数据技术的快速发展,现有的离群挖掘算法效率可能显著下降甚至不适用.Spark内存计算可以有效地降低I/O成本,并能提高数据分析和处理的效率.使用Spark内存计算平台,提出了一种离群数据并行挖掘算法,目的是在Spark这样的大数据平台上对传统离群挖掘算法进行并行化,从而提高性能.最后以UCI数据集作为实验数据集对算法进行了验证,实验结果表明,基于Spark平台的离群数据并行挖掘算法具有良好的可伸缩性和可扩展性.
关键词:大数据技术离群挖掘Spark平台并行挖掘
分类号:TP301(计算技术、计算机技术)
资助基金:国家自然科学基金(61602335)
论文发表日期:2018-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 2175-2178 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2018,46(11)
所属栏目:算法与分析