《网络爬虫项目实践》 课件 项目1、2 网页数据获取、特殊网页数据获取.pptx

《网络爬虫项目实践》 课件 项目1、2 网页数据获取、特殊网页数据获取.pptx

;;任务1.1 读书网信息爬取;任务描述;;1.网页结构分析;2.解决爬虫中文乱码;2.解决爬虫中文乱码;3.网页数据爬取;3.网页数据爬取;3.网页数据爬取;3.网页数据爬取;3.网页数据爬取;完整代码;请将书海网图书链接和书名信息爬取下来;任务1.2 今日头条数据爬取;任务描述;在今日头条中搜索关键字 过滤重定向网页 下载图片信息保存至本地 保存链接信息至mongoDB;今日头条是采用AJAX持续不断的请求内容,因此在抓取网页数据时候,需要发送AJAX请求,而不是普通请求。 进入今日头条官网(/),在搜索框中输入“街拍”,可以进入搜索结果页面。此时按F12键调出开发人员工具,然后刷新页面。在开发人员工具中,点击Network,勾选“Preserve log”和“Hide data URLs”,并点击All,会发现此时的Preview中的内容被隐藏了。如图1-14所示预览内容被隐藏,也就是返回数据被隐藏起来了。;切换到“XHR”选项,这时在Preview选项中就可以找到返回来的Json数据,如图1-15所示,页面中的数据被以Json返回,并且在Json数据中的key为“data”。;切换到“Headers”选项卡,这是可以看到“Request URL”中写的URL是以“/api/search/content/?”开头的地址,而实际浏览器中的地址是“/search/?keyword

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档