基于Scrapy的分布式爬虫系统的设计与实现
李代祎1
谢丽艳2
钱慎一1
吴怀广1
1.郑州轻工业学院 计算机与通信工程学院,河南 郑州,4500022.河南省工商行政管理学校,河南 郑州,450002
摘要:随着互联网的快速发展,其信息量和相关服务也随之快速增长.如何从海量的信息中快速、准确地抓取所需要的信息变得越来越重要,因此负责互联网信息收集工作的网络爬虫将面临着巨大的机遇和挑战.目前国内外一些大型搜索引擎只给用户提供不可制定的搜索服务,而单机的网络爬虫又难当重任,因此可定制性强、信息采集速度快和规模大的分布式网络爬虫便应运而生.通过对原有Scrapy框架的学习和研究,将Scrapy和Redis结合改进原有的爬虫框架,设计并实现了一个基于Scrapy框架下的分布式网络爬虫系统,然后将从安居客、58同城、搜房等网站抓取的二手房信息存入MongoDB中,便于对数据进行进一步的处理和分析.结果表明基于Scrapy框架下的分布式网络爬虫系统同单机网络爬虫系统相比效率更高且更稳定.
关键词:Scrapy分布式Scrapy-Reids网络爬虫MongoDB数据存储
分类号:TP3(计算技术、计算机技术)
资助基金:国家自然科学基金(61672470)河南省科技攻关计划(162102410076)国家科技重大专项(161100110900)
论文发表日期:2017-07-02
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 317-322 )
英文信息
