一个基于分层的网页文本过滤系统
周聚1
李培峰1
朱巧明2
1.苏州大学计算机科学与技术学院,苏州,215006;苏州大学江苏省计算机信息处理技术重点实验室,苏州,2150062.苏州大学江苏省计算机信息处理技术重点实验室,苏州,215006
摘要:设计并实现了一种高效率、高性能的网页文本过滤系统,该系统采用分层过滤策略,包括实时过滤和事后分析.实时过滤模块是基于Linux下的IP Queue机制实现的,采用高效的过滤策略,在保证过滤实时性的同时也保证了过滤的准确性;事后分析模块研究过滤系统经过协议还原后备份的网页文本,通过网页预处理、非法关键词抽取、特征选择等步骤,实现了基于二元模型的文本过滤方法,该方法在一定大小的词语距离窗口内,采用包含非法关键词的二元词串作为特征,解决了使用二元词串带来数据稀疏的问题,同时保留了二元词串的强类别分辨能力的特征.实验表明,文章实现的过滤系统有较高的效率和准确率,用于事后分析的基于二元模型的文本过滤方法达到了较高的性能,其准确率、召唤率和F1的值分别为:96.98%,85.75%和91.02%.
关键词:分层过滤文本过滤二元词串抽取窗口
分类号:TP393(计算技术、计算机技术)
资助基金:国家自然科学基金(90920004,60970056,60873150)江苏省自然科学基金(BK2008160)基础研究项目(08KJA520002)
论文发表日期:2010-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 18-21 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2010,38(8)