(2)--第2章 网络爬虫原理网络数据爬取与处理.pdfVIP

  • 2
  • 0
  • 约3.37千字
  • 约 26页
  • 2024-04-08 发布于江苏
  • 举报

(2)--第2章 网络爬虫原理网络数据爬取与处理.pdf

网络数据爬取与处理

第二章网络爬虫原理

1.网络爬虫概念

2.网络爬虫原理

3.HTTP协议

4.数据在网页中的存在形式

5.网络爬虫的法律与道德约束

6.网络爬虫实例

2-1网络爬虫概念

网络爬虫概念

网络爬虫(WebCrawler)又名网络蜘蛛(Webspider),是一种模拟浏览器

行为,自动化浏览网络资源并采集互联网上公开数据的程序。

网络爬虫的本质是一个递归的过程。首先获取一个URL对应的网页内容,

然后从该网页中提取另一个URL,再获取该URL对应的网页内容,并不断

的循环这一过程。

网络爬虫的类型

通用爬虫:爬取全网数据搜索引擎

聚焦爬虫:聚焦于某个主题、某个网站、某个网页

爬取网页

数据量小,但目标数据包含在大量网页中,

对爬取速度不敏感,替代繁琐的人工操作。

Requests库

聚焦爬虫

爬取网站

数据量较大,目标数据为整个网站的数

据,对爬取速度敏感。

Scrapy库

爬取全网

数据量非常大,目标数据为全网数据,

文档评论(0)

1亿VIP精品文档

相关文档