基于信息熵属性约简的相似重复记录检测方法
陈彦萍
洪明杰
杨小宝
西安邮电大学 西安 710121
摘要:相似记录检测已成为数据清洗的一个重要分支,也是消除数据冗余提高数据质量的一个重要途径,在数据统计、数据分析、数据仓库、人工智能和数据挖掘等领域都有实际应用.该文对目前相似记录检测方法进行了研究,针对诸多方法都存在检测精度不足和时效慢的问题,采用K-Modes进行聚类分组的方法,通过信息熵理论来确定属性权重并约简属性维度,同时在记录匹配阶段依据属性重要程度对各聚类分组的数据逐属性进行比较,根据阈值来判断其相似性,避免整条记录参与匹配耗费时间,在完成对每个数据集的检测后最终消除相似重复记录.实验表明,该方法能有效缩小检测数据集范围和相似匹配效率,提高检测精度和时间效率,具有较高的查全率和查准率.
关键词:相似重复记录K-Modes聚类算法信息熵相似检测
分类号:TP18(自动化基础理论)
资助基金:陕西省科技统筹创新工程计划(2016KTZDGY04-01)陕西省教育厅专项科研项目(16JK1701)
论文发表日期:2019-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 2966-2972 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2019,47(12)
所属栏目:算法与分析