一种基于样本学习复杂度的不平衡数据过采样方法
许皓
孙廷凯
1.南京理工大学计算机科学与工程学院 南京 2100942.南京理工大学计算机科学与工程学院 南京 210094
摘要:在人们的生活中存在大量的不平衡数据,如何识别人们感兴趣的少数类是一个具有挑战性的问题.论文基于ADASYN算法中提出的样本学习复杂度的思想,设计了一种新的过采样方法LDSMOTE.在该方法中,少数类主样本的学习复杂度与该主样本在少数类和多数类样本空间的分布都有关,ADASYN只利用了邻域多数类样本分布信息,而LDSMOTE融合了局部少数类平均距离和局部多数类样本数的信息.不同于ADASYN中复杂度是离散值,论文中的复杂度是连续的值,更能表现不同主样本之间的差异性和复杂度的多样性.分类器使用支持向量机,对KEEL不平衡数据库中的19个数据集进行实验,结果表明,在超过半数的数据集上,LDSMOTE的Recall、G-mean和AUC性能优于SMOTE、Borderline-SMOTE以及ADASYN算法.
关键词:过采样不平衡数据主样本学习复杂度样本分布
分类号:P624.4(地质、矿产普查与勘探)
论文发表日期:2020-08-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 1846-1851,1857 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2020,48(8)
所属栏目:算法与分析