- 177
- 0
- 约4.23万字
- 约 64页
- 2019-06-01 发布于浙江
- 举报
抓取网页的含义和URL基本构成
1、网络爬虫的定义
网络爬虫,即Web Spider,是一个很形象的名字。
把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页的。
从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,
然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。
如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。
这样看来,网络爬虫就是一个爬行程序,一个抓取网页的程序。
网络爬虫的基本操作是抓取网页。
那么如何才能随心所欲地获得自己想要的页面?
我们先从URL开始。
2、浏览网页的过程
抓取网页的过程其实和读者平时使用IE浏览器浏览网页的道理是一样的。
比如说你在浏览器的地址栏中输入 ? ? ? ?这个地址。
打开网页的过程其实就是浏览器作为一个浏览的“客户端”,向服务器端发送了 一次请求,把服务器端的文件“抓”到本地,再进行解释、展现。
HTML是一种标记语言,用标签标记内容并加以解析和区分。
浏览器的功能是将获取到的HTML代码进行解析,然后将原始的代码转变成我们直接看到的网站页面。
3、URI的概念和举例
简单的来讲,URL就是在浏览器端输入的?? ? ? ?这个字符串。
在理解URL之前,首先要理
您可能关注的文档
- PCBA-DIP-检验标准.doc
- PDCA范本.doc
- PC系统与安卓系统对接方案的案例.doc
- PEG指标研究.doc
- pep2014最新版四年级英语下册unit1-3备课.doc
- PEP-四年级上册Unit-Four--My-Home.doc
- PEP08-09年小学三年级英语上册测试题(含听力).doc
- PEPWING公司创建民主法治示范企业材料.doc
- PEP三年级英语下册Recycle-1教案和教学反思.doc
- pep三年级下册第二单元知识点及练习.doc
- QC活动-4-QC小组自我检查表.doc
- QEO管理体系各部门风险评估.docx
- QGD212-03-01----06成品抽样检验记录.doc
- QDZTS-HR-09-001《薪酬福利制度》.doc
- QHD32-6油田氮气泡沫驱高温高压可视化实验研究—郑继龙.doc
- Q-FDA-010-2016汽车转向横拉杆总成性能要求及台架试验方法(最终版本)修订20160121——A.doc
- QMYQP-12S-风险管理控制程序20170825.docx
- Qn-xipz004项目立项报告模板—2009年新版.doc
- QP12生产设备维护保养控制程序.doc
- qi1、李《安全专业-生产矿井通风系统设计》指导2011.11.doc
最近下载
- 上海市2026年中考考纲《语文课程终结性评价指南》.docx VIP
- 中国政治制度史.pptx VIP
- 量子力学导论(第二版)曾谨言+北京大学出版社+课后答案解析.pdf VIP
- 各星级酒店功能区面积配置.docx VIP
- DB23∕T 1073-2017 黑龙江省建筑防水工程技术标准(2024年版).docx VIP
- 预应力混凝土空心方桩08SG360.docx VIP
- 50098马工程经济法学(第二版)全套PPT课件.pptx
- 聚醚砜-PES-MSDS介绍文档.docx VIP
- DB63∕T 1489-2016 多年冻土区 热棒路基技术规范.docx VIP
- 2026年生物科技仿生材料报告及未来十年材料科学报告.docx
原创力文档

文档评论(0)