网络爬虫项目实践(下篇,共计上下2篇).pptxVIP

  • 3
  • 0
  • 约 190页
  • 2023-09-12 发布于安徽
  • 举报

网络爬虫项目实践(下篇,共计上下2篇).pptx

根据相关教材和网络资源整理制作,可作为授课教师的参考资料和专业学生、从业人员的自学资料。如有侵权,请联系删除!

网络爬虫项目实战项目三:scrapy框架爬虫主讲人:xxx 231任务2.2 登录赶集网任务2.1当当网商品爬取任务2.3 失信人信息爬取目录 任务2.1当当网商品爬取 任务描述本任务通过抓取失信人名称、失信人号码、法人(企业)、年龄(企业的年龄为0)、区域、失信内容、公布日期、公布执行单位、 创建日期和更新日期等信息,并将抓取的数据,统一存储到MySQL数据库中以供后续分析使用。 获取百度失信人名单将名单信息保存到MySQL数据库中实现随机User-Agent下载器中间件实现代理IP下载器中间件任务目标 1 创建Scrapy项目首先进入cmd命令窗口,然后进入本地磁盘中的项目保存目录(该目录自己选定),如图3-2所示:任务实施 1 创建爬虫项目使用Scrapy命令新建项目名为“dangdang”的项目,命令如下:任务实施scrapy startproject dangdang此时在项目保存目录多了一个项目名为“dangdang”的项目,如图3-3所示 1 创建爬虫项目cd进入“dangdang”项目目录,并基于“basic模板”创建爬虫文件,命令如下:任务实施scrapy genspider -t basic dd 可以看到在项目根目录的“dangdang”目录下面的“spiders”创建了名为“dd”的爬虫文件,如图3-4所示: 2 商品数据爬取1、 安装XPath插件打开谷歌

文档评论(0)

1亿VIP精品文档

相关文档