Web使用挖掘中的数据预处理方法
刘上力
赵劲强
聂勤务
1.湖南科技大学,网络信息中心,湖南,湘潭,4112012.湖南科技大学,网络信息中心,湖南,湘潭,4112013.湖南科技大学,网络信息中心,湖南,湘潭,411201
摘要:对Web使用挖掘的数据预处理的数据清理、用户识别、会话识别、路径补充和事务识别5个主要步骤的最新研究进展进行综述.采用拓扑结构结合引用页的路径补充算法和采用最大向前引用的事务识别算法,识别特性单一、对训练数据集的要求较高,故离实际应用还有一定的距离.针对此,从Cookie技术和启发式规则相结合、动态时间阈值法以及多特性融合等方面对数据预处理的用户识别、会话识别和事务识别提出了优化建议.
关键词:Web挖掘网络日志数据预处理
分类号:TP392(计算技术、计算机技术)
资助基金:湖南省教育厅科学研究项目(08C335)湖南科技大学教学研究与改革重点项目(G30946)
论文发表日期:2010-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 71-74 )
英文信息
