《网络爬虫项目实践》 教案 李程文 项目1、2 网页数据获取、特殊网页数据获取.docx

《网络爬虫项目实践》 教案 李程文 项目1、2 网页数据获取、特殊网页数据获取.docx

项目一 网页数据获取 教案 课程名称:网络爬虫项目实践 课程类别:必修 适用专业:大数据技术类相关专业 总学时:64学时(其中理论28学时,实验36学时) 总学分:4.0学分 本章学时:3学时 材料清单 《网络爬虫项目实践》教材。 配套PPT。 引导性提问。 探究性问题。 拓展性问题。 教学目标与基本要求 教学目标 网页数据爬取是互联网行业的一项重要的基础能力,“网页数据”包括网页上的文字、图像、声音、视频和动画等。本项目网页数据获取将通过三个任务由浅入深来完成如何爬取网页数据。任务1,通过读书网信息爬取任务,介绍正则表达式爬取数据方法,以及处理数据乱码和爬取链接不完整的方法。任务2,通过今日头条数据爬取任务,阐述关键字搜索、重定向网页过滤、MongoDB数据库使用方法。最后,任务3,通过京东动态渲染页面的信息爬取,讲授了动态渲染页面的爬取过程、Selenium构造自定义浏览器渲染引擎搜索关键字和模拟翻页、PyQuery分析页面源代码获取商品内容,最后保存数据信息至MongoDB。 、基本要求 熟练掌握第三方库的安装方法 熟练掌握requests库的使用 熟练掌握re库的使用 熟练掌握JOSN数据爬取方式 熟练掌握Selenium、PyMongo、PyQuery模块的使用方法 熟练使用Python的多进程数据爬取方式 熟练掌握爬虫结果乱码处理方式 问题 引导性提问 引导性提问需

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档