第3章 抓取静态网页数据.pptxVIP

  • 1
  • 0
  • 约3.28千字
  • 约 28页
  • 2026-09-16 发布于福建
  • 举报

抓取静态网页数据

内容导航01课程概述与环境准备02urllib库基础使用03requests库进阶使用04课程总结与作业布置

课程概述与环境准备01

内容提要与学习目标爬虫开发环境搭建、urllib库使用、requests库使用三大模块核心内容模块熟悉爬虫开发环境,独立完成urllib和requests库的基础请求编写能力达成目标允许借助AI生成代码框架、排查语法错误,最终需自行运行验证结果AI工具使用说明

使用Python3.6及以上版本,搭配Pycharm2018及以上开发工具基础环境要求查询Python版本,确认开发环境符合要求小任务:环境配置验证分为网页抓取、内容解析、数据存储、动态网页抓取、验证码识别、爬虫框架六大类常用库分类介绍010203爬虫开发环境配置

常用库分类介绍1)抓取网页:urllib(或urllib3)、requests、requests-html2)解析网页:lxml、beautifulsoup4、pyquery(基于lxml)3)存储数据:csv、xlwt(或xlsxwriter)、MongoDB、redis4)抓取动态网页:selenium、pyppeteer、splash、playwright、DrissionPage5)验证码识别:pytesseract结合pillow、baidu-aip、ddddocr6)爬虫框架:scrapy、pysp

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档