Scrapy框架高效爬虫技术解析.pptVIP

  • 1
  • 0
  • 约4.52千字
  • 约 38页
  • 2026-09-09 发布于北京
  • 举报

Scrapy爬虫;1;Scrapy是一种爬虫框架而非功效函数库,简单地说,它是一种半成品,能够协助顾客简单快速地布署一种专业的网络爬虫。Scrapy爬虫框架主要由引擎(Engine)、调度器(Scheduler)、下载器(Downloader)、Spiders、ItemPipelines、下载器中间件(DownloaderMiddlewares)、Spider中间件(SpiderMiddlewares)这7个组件组成。;引擎负责控制数据流在系统所有组件中的流向,并在不同的条件时触发相相应的事件。这个组件相当于爬虫的“大脑”,是整个爬虫的调度中心。

2.调度器(Scheduler)

调度器从引擎接受祈求并将它们加入队列,方便之后引擎需要它们时提供给引擎。初始爬取的URL和后续在网页中获取的待爬取的URL都将放入调度器中,等候爬取,同步调度器会自动去除重复的URL。假如特定的URL不需要去重也能够通过设置实现,如post祈求的URL。

;下载器的主要功效是获取网页内容,提供给引擎和Spiders。

4.Spiders

Spiders是Scrapy顾客编写用于分析响应,并提取Items或额外跟进的URL的一种类。每个Spider负责处理一种(某些)特定网站。

;ItemPipelines主要功效是处理被Spiders提取出来的Items。典型的处理有清理、验证及持久化(例如存取到

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档