网络爬虫项目实践(上篇,共计上下2篇).pptxVIP

  • 2
  • 0
  • 约1.36万字
  • 约 84页
  • 2023-09-12 发布于安徽
  • 举报

网络爬虫项目实践(上篇,共计上下2篇).pptx

网络爬虫项目实战项目一:网页数据获取主讲人:xxx 231任务1.2 今日头条数据爬取 任务1.1 读书网信息爬取任务1.3 京东动态渲染页面的信息爬取目录 任务1.1 读书网信息爬取 任务描述读书网是中国国内优秀的读书平台,同时也是集书籍查询、作者介绍、刊物定价、出版社、ISBN查询的公益读书网站。在网站首页有一个“在线读书”栏目,本任务的目的是爬取“在线读书”栏目中图书的详情页链接、书名和作者信息,“在线读书”栏目如图所示。 任务目标要实现读书网“在线读书”栏目中图书的详情页链接、书名和作者信息,需要学习以下知识:掌握使用正则表达式爬取数据的方法掌握处理爬取数据乱码的方法掌握爬取连接不完整情况处理的方法 1.网页结构分析进入读书网网站首页,按F12键查看网页源代码,如图1-2所示。从源代码可以看出,整个在线读书是用一个div标签标包括起来的,每一本书用一个li标签表示,本任务需要爬取的书籍链接由a标签的href属性标示,书名由a标签包括起来,作者信息由标有class=“bookauthor”的div标签包括。通过源码分析,会发现一个问题,网页源码中的书籍链接信息只有一部分,而不是完整链接,因此需要进行URL补全。任务实施 2.解决爬虫中文乱码通过F12键查看网页源代码的head部分的编码,如图1-8所示,发现网页编码类型为UTF-8。任务实施利用requests库的encodi

文档评论(0)

1亿VIP精品文档

相关文档