基于自动生成模板的Web信息抽取技术
张彦超
刘云
李勇
沈波
1.北京交通大学电子信息工程学院,北京,1000442.北京交通大学电子信息工程学院,北京,1000443.北京交通大学电子信息工程学院,北京,1000444.北京交通大学电子信息工程学院,北京,100044
摘要:在网络舆情分析中,人们迫切需要自动化的工具在海量信息中抽取所需要的信息,以供进一步分析利用.针对此问题,提出了基于自动生成模板的Web信息抽取方法,可以消除网页噪声,快速有效地抽取所需的网页信息.该方法通过解析器将Web文档解析成文档对象模型,根据用户需求建立抽取规则,采用自动生成模板机制,并依据模板的抽取规则对网页信息进行抽取.实验证明,该抽取方法具有较高的召回率和准确率.
关键词:信息抽取模板文档对象模型XPath网络舆情
分类号:TP391(计算技术、计算机技术)
资助基金:教育部高等学校科技创新工程重人项目(707006)通信与信息系统北京市重点实验窀资助项目(35304536)北京市教育人建项日专项资助(W0810040)
论文发表日期:2009-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 40-45 )
英文信息
