- 2
- 0
- 约3.37千字
- 约 26页
- 2024-04-08 发布于江苏
- 举报
网络数据爬取与处理
第二章网络爬虫原理
1.网络爬虫概念
2.网络爬虫原理
3.HTTP协议
4.数据在网页中的存在形式
5.网络爬虫的法律与道德约束
6.网络爬虫实例
2-1网络爬虫概念
网络爬虫概念
网络爬虫(WebCrawler)又名网络蜘蛛(Webspider),是一种模拟浏览器
行为,自动化浏览网络资源并采集互联网上公开数据的程序。
网络爬虫的本质是一个递归的过程。首先获取一个URL对应的网页内容,
然后从该网页中提取另一个URL,再获取该URL对应的网页内容,并不断
的循环这一过程。
网络爬虫的类型
通用爬虫:爬取全网数据搜索引擎
聚焦爬虫:聚焦于某个主题、某个网站、某个网页
爬取网页
数据量小,但目标数据包含在大量网页中,
对爬取速度不敏感,替代繁琐的人工操作。
Requests库
聚焦爬虫
爬取网站
数据量较大,目标数据为整个网站的数
据,对爬取速度敏感。
Scrapy库
爬取全网
数据量非常大,目标数据为全网数据,
您可能关注的文档
最近下载
- GB/T 36213-2018 船舶与海上技术 船舶系泊和拖带设备 系泊导缆孔.pdf
- 构网型储能的基本原理(华北电力大学).pptx VIP
- 2026年最新人教版七年级(初一)数学上册教学计划及进度表(新课标,新教材).docx
- 构网型储能技术应用研究与探索(30页PPT).pptx VIP
- 新型电力系统下构网型储能技术研究与应用--华为 杨志(16页 PPT).pptx VIP
- 新型电力系统背景下构网型储能变流器的设计与思考(26页 PPT).pptx VIP
- 一家三口共用奶奶.docx VIP
- 《道路勘测设计》全套教学课件.pptx
- 地贫诊断相关知识与产前诊断课件.ppt VIP
- 地贫防治知识及项目管理课件.pptx VIP
原创力文档

文档评论(0)