基于增量聚类的电子政务短文本信息挖掘算法研究
冷泳林1
郭颖1
孙晓红2
曲珮漪1
1.渤海大学信息科学与技术学院,辽宁锦州 1210132.渤海大学管理学院,辽宁锦州 121013
摘要:电子政务平台每天都会产生大量短文本数据,挖掘短文本数据对政府掌握民意有十分重要的作用.针对短文本信息量少,单一短文本向量表示模型产生的特征信息丢失问题,提出一种融合权重及主题特征的混合向量表示模型.该模型利用Word2vec和TF-IDF算法挖掘短文本的局部特征,利用BTM主题模型挖掘短文本全局特征,然后将两种特征向量进行连接构成短文本向量.针对短文本数据增量变化特征,通过增加限定阈值改进传统Single-Pass聚类算法,实现短文本的增量聚类.实验结果表明,该模型能够有效的提高短文本聚类效果.
关键词:电子政务短文本向量表示模型增量聚类
分类号:TP391(计算技术、计算机技术)
资助基金:辽宁省社会科学基金项目(NoL14AGL002)辽宁省社会科学基金项目(NoL13AGL002)
论文发表日期:2023-09-15
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 262-269 )
英文信息
