一种面向大规模网页去重的三层分布式架构
贲兴龙
贾大文
袁林
1.中国电子科技集团第二十八研究所 南京 2100002.中国电子科技集团第二十八研究所 南京 2100003.中国电子科技集团第二十八研究所 南京 210000
摘要:去除重复网页是网页爬取过程中必要的步骤,目前人们对网页去重方法的研究集中在基于网页内容相似的去重算法本身的准确性和算法复杂度上。论文提出一种面向大规模网页去重的三层分布式架构,其利用本地缓存、分布式缓存及分布式索引高效地判断重复网页,特别适用于网页内容更新频繁需要反复爬取的应用场景。实验分析结果表明论文提出的三层分布式架构可以支持分布式网络爬虫环境下大规模的网页去重需求,并且具有较好的可扩展性。
关键词:网页去重网络爬虫分布式架构
论文发表日期:2015-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 1751-1755 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2015,(10)
所属栏目:专栏 ? Web 信息系统及应用