面向信息SNP选择的聚类算法
邢斌1
周从华1
张付全2
张婷3
蒋跃明4
1.江苏大学计算机科学与通信工程学院 镇江 2120132.无锡市精神卫生中心 无锡 2141513.无锡市妇幼保健院 无锡 2140024.无锡市第五人民医院 无锡 214073
摘要:SNP数据在人类遗传病诊断与治疗中存在重要作用,但SNP原始数据存在大量冗余,因此需要选择出信息量大的SNP,完成SNP数据的降维.针对常用聚类算法应用到信息SNP选择时未考虑单个SNP与SNP子集之间相似度的问题,采用一种新的相似度度量方法,提出了一种改进的聚类算法K-MIGS,并将其应用到SNP选择中.K-MIGS算法解决了传统K-means不能挖掘出SNP位点与SNP子集之间的强相关性问题,并在医院提供的临床数据实验中表明,K-MIGS具有更高的非信息SNP子集重构度.最后使用支持向量机、决策树和神经网络对构造的SNP子集进行分类实验,对比K-means、特征加权K-means、ReliefF和MCMR,结果表明K-MIGS分类准确率和F1指标上提升了10%和15%,充分说明K-MIGS在信息SNP选择中具有更好的效果.
关键词:单核苷酸多态性SNP选择相似度度量K-means
分类号:TP391(计算技术、计算机技术)
资助基金:江苏省重点研发计划(社会发展)项目(BE2016630,BE2017628)无锡市卫生计生委科研项目(Z201603)
论文发表日期:2021-10-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 1983-1987,2008 )
英文信息
