解决方案网页.docxVIP

  • 7
  • 0
  • 约5.25千字
  • 约 10页
  • 2018-11-21 发布于贵州
  • 举报
解决方案网页

解决方案网页   篇一:网页爬虫解决方案   网页爬虫解决方案   1. 需求(质量、性能)   1. 对于复杂型文本(如:一个标签中包含多个要提取的词或其他多余的词)要进行分词处理。   2. 对于无法处理的页面或文件,需将整个页面或文件以二进制形式保存。   3. 对于关键字段(如:处罚对象、处罚时间等),确保精确度在99%以上,要求去掉HTML标签、标点符号和无关单词。   4. 提高爬虫的性能,对于增量数据要求在一小时内爬取完成。   5. 针对现有爬虫无法达到上述目标,需调整项目方案。   2. 开发方案   分布式架构   整个爬取过程采用分布式架构,对于90多个网站来说,将任务并行处理,可以有效的提高爬取效率。   采用Linux+Hadoop进行分布式架构搭建,Hadoop的框架最核心的设计就是:HDFS和MapReduce。HDFS为海量的数据提供了存储,则MapReduce为海量的数据提供了计算。   Hadoop是一个能够让用户轻松架构和使用的分布式计算平台。用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。它主要有以下几个优点:   1. 高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖。   2. 高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可

文档评论(0)

1亿VIP精品文档

相关文档