基于LLE-k均值方法的中文文本聚类
冯燕
王洪元
程起才
刘爱萍
1.常州大学信息工程学院,常州,2131642.常州大学信息工程学院,常州,2131643.常州大学信息工程学院,常州,2131644.常州大学信息工程学院,常州,213164
摘要:文本聚类中,文本特征向量的高维特性使得对样本统计特征的评估十分困难,所以有必要进行有效的维数简约.LLE算法利用线性重构的局部对称性找出高维数据空间中的非线性结构,并在保持各数据点临近位置关系情况下,把高维空间数据点映射为低维空间对应的数据点.文章采用LLE-k均值方法进行中文文本聚类研究.首先利用LLE进行降维处理,然后对得到的线性特征向量用k均值进行聚类分析,与PCA、ISOMAP和LLE算法比较,结果显示LLE-k均值算法能得到更好的可视化效果.
关键词:文本聚类LLE维数简约k-means
分类号:TP391(计算技术、计算机技术)
资助基金:国家自然科学基金(60973094)江苏省自然科学基金(BK2009538)江苏省高等学校自然科学研究项目(08KJB520002,09KJB520004)国家基金项目(61070121)
论文发表日期:2010-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 10-12,21 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2010,38(11)