网络爬虫中的多线程设计模式..docVIP

下载本文档

1
0
约8.4千字
约 8页
2017-01-22 发布于重庆
举报
版权申诉

网络爬虫中的多线程设计模式..doc

1、本文档共8页，可阅读全部内容。
2、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。
3、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
5、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
6、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
7、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
8、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

网络爬虫中的多线程设计模式.

爬虫中涉及到的多线程设计模式做个小整理，重点加深读写锁模式的理解。内容如下： ===问题细节说明 ===网页抓取：生产者消费者模式（多v多） ===URL去重：读写锁模式 ===网页写入文件：生产者消费者模式（多v一） ===关于多线程的几点注意 ========================================= 问题细节说明 1）简述一下这里涉及到的三个过程：a）爬虫从待爬取URL队列中取得URL进行抓取，抓取来的网页进行解析提取新的链接加入到待爬取URL队列；b）爬取每个网页之前，程序会到已爬取URL表中查询该URL是否已经爬取过；c）网页爬取完，网页解析的内容要写入文件上述三个过程都是在多线程的环境下进行处理，涉及到的共享资源有：URL任务队列、已爬取的URL表，存储网页内容的文件。这些共享资源的读与写都需要处理好线程的同步互斥，以保证线程安全。 2）注：爬虫中多线程的管理实际是需要维护一个线程池；URL去重也是使用MD5结合布隆过滤器进行实现的；上述所述三个过程在爬虫中并不是独立的，而是互相结合工作的，但是为了提取模式特点，我们将其分拆开，在讲述一个模式过程中如果涉及到其他模式，便略去不谈。所以，这里仅仅提取爬虫中的多线程设计模式，举例重在了解模式工作原理，不涉及爬虫具体实现的过多细节。 ========================================= 网页抓取：生产者消费者模式（多v多） 1）生产者消费者模式学过操作系统应该对这个概念很熟悉，简单来说就是“你生产我消费”；该模式分为三个部分：生产者，消费者和产品队列（爬虫中该产品就是URL任务队列，故以下称任务队列）。该模式可灵活应用，生产者和消费者的比例可以是：多v多，多v一，一v多；该模式解决多线程同步问题的思想是：对任务队列加锁，队列的出队和入队操作原子性；该模式应用到多线程爬虫：抓取线程主动去任务队列找活干，如果没活就等待，有活了就通知那些等待的抓取线程。 2）简单示例代码在爬虫中，生产者是网页的抓取线程，消费者也是网页的抓取线程，所以这里只要两个类就可以了，一个网页抓取线程类WorkThread，一个任务队列类TaskQueue；简单示例如下，在TaskQueue类中，使用Synchronized关键字使当前线程取得对象TaskQueue的锁，并用wait和notifyAll函数进行线程间通信。 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 /* 任务队列类 */ public class TaskQueue { private Queueurl taskbuffer; private int taskcount; private int maxN; public TaskQueue(int max) { maxN = max; taskbuffer = new Queueurl(maxN); taskcount = 0; } // 生产者调用的任务入队操作 public synchronized void addTask(Listurl urlList) { while(maxN = taskcount)// 如果队列够大，while语句块可以略 { wait(); // 进入TaskQueue对象等待池，释放锁 } while(!urlList.isEmpty()) { taskbuffer.add(str); taskcount++; } notifyAll(); // 唤醒等待池线程 } // 消费者调动的任务出队操作 public synchronized url getTask() { while(taskcount = 0) { wait(); } url str = task