基于selenium的数据采集系统的设计与实现.docx

基于selenium的数据采集系统的设计与实现.docx

摘要

“网络爬虫”目前也被称为“网络蜘蛛”[5]。它是一个在互联网上自动收集数据的自动程序。爬虫的规模可以大也可以小,从百度、谷歌搜索到图片自动下载。

收集的数据是结构化的,分批提取,提高了效率。比如我们希望在一个电子商务平台上获得某个产品的相关信息,可能包括产品名称、产品价格、评价参数、广告、评论内容等。如果我们只想要用户的有利信息,其余的就不需要了。如果是以表格的形式保存,此处的表就是结构之后的结果。如果数据的量比较小,我们可以手动复制和粘贴,但是当数据量在一千或十万以上的时候,复制粘贴的效率显然太低,也无法保证其准确性[4],如果我们使用selenium提取的话,它正确率高

文档评论(0)

1亿VIP精品文档

相关文档