基于XML的密集型Web信息抽取与集成研究
卢中宁1
刘放美1
严宇辉2
1.郑州轻工业学院,计算机与通信工程学院,河南,郑州,4500022.河南省农业银行,银行卡部,河南,郑州,450016
摘要:针对密集型Web信息的数据抽取问题,提出了一种适合于XML结构又较为通用的树型结构抽取规则,把密集型Web上的数据抽取出来整合到指定模式的XML文档中.使用基于样例学习的半结构化Web信息抽取方法,自行开发了一个基于XML的Web新书查询原型系统,抽取Web页面效果良好,可直接应用于专门的Web网站信息的抽取,也可以用于其他相关应用的数据准备阶段.
关键词:XML密集型Web数据数据抽取信息集成
分类号:TP391.1(计算技术、计算机技术)
资助基金:河南省自然科学基金(0411010500)
论文发表日期:2008-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 31-35 )
英文信息展开
郑州轻工业学院学报(自然科学版)

郑州轻工业学院学报(自然科学版)

CSTPCD
ISSN:1004-1478
年,卷(期):2008,23(3)
所属栏目:网络工程