- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
基于广度优先算法的多线程网络爬虫毕业设计沈阳理工大学
摘要
目前即使通讯软件在平时的生活中有着十分广泛的应用,但是对绝大部分的软件来说,都必须应用在互联网上,必须在一个Internet环境下才能使用。有时候单位内部的员工,同学,在没有互联网环境下或因其他原因希望不用INTERNET就可以进行信息交互,这样开发局域网通信就有了必要性。本文提出了局域网信息交互的需求,并详细对网络协议TCP/IP 协议族进行了介绍和研究,如TCP,UDP,广播等相关技术。并对网络信息交互原理惊醒了说明,在此基础上利用SOCKET网络编程实现了一种基于WINDOWS平台的局域网信息交互功能。
网络爬虫是一种自动搜集互联网信息的程序。通过网络爬虫不仅能够为搜索引擎采集网络信息,而且可以作为定向信息采集器,定向采集某些网站下的特定信息,如招聘信息,租房信息等。
本文通过JAVA实现了一个基于广度优先算法的多线程爬虫程序。为何要使用多线程,以及如何实现多线程;系统实现过程中的数据存储;网页信息解析等。
通过实现这一爬虫程序,可以搜集某一站点的URLs,并将搜集到的URLs存入数据库。将解析的网页存入XML文档。
【关键词】software must be used in the Internet , and it must be used in a Internet environment .Sometimes Internal staff, students ,may not have the Internet environment or other reasons do not wish to be able to communicate on the Internet .This development will have a need for LAN communication program .Therefore ,this paper presents the needs of local area network exchange information Software ,And details of the network protocol TCP/IP protocol suite are introduced and research such as TCP, UDP, broadcast ,and other technologies . and network information exchange theory is discussed . Base on this condition I use of Socket Network programming based on Windows platform to develop a LAN chat application .
SPIDER is a program which can auto collect informations from internet. SPIDER can collect data for search engines, also can be a Directional information collector, collects specifically informations from some web sites, such as HR informations, house rent informations.
In this paper, use JAVA implements a breadth-first algorithm multi-thread SPDIER. This paper expatiates some major problems of SPIDER: why to use multi-threading, and how to implement multi-thread; data structure; HTML code parse. etc. This SPIDER can collect URLs from one web site, and store URLs into database.
【KEY WORD】SPIDER; JAVASocket programming; TCP/IP ;
Network programming 目录
1 绪论 1
1.1 网络爬虫的发展 1
1.2 国内外技术发展现状 2
1.3 系统设计的意义 3
2 总体设计方案 4
2.1 系统设计方案 4
您可能关注的文档
- 基于stm32的温度控制毕业论文p41.doc
- 基于Struts和Hibernate的教学答疑系统毕业论文57页.doc
- 基于Struts架构的办公自动化系统毕业论文2011年11月.doc
- 基于SUPANET的故障恢复研究_网络硕士论文西南交通大学.doc
- 基于STS的预付费代码表及售电系统论文2012年4月.doc
- 基于SystemView的差错控制技术研究学士学位论文理工大学.doc
- 基于SVM车型识别系统的设计与实现_毕业设计陕西理工学院.doc
- 基于SystemView的数字通信系统的仿真设计毕业论文【推荐】.doc
- 基于TD-SCDMA的核心网CS域的通信技术研究毕业设计论文【56p】.doc
- 基于TMS320F2812太阳能跟踪系统的设计—电池板仰角跟踪模式_毕业设计报告(论文) 东南大学成贤学院.doc
- 基于小波变换神经网络入侵检测系统的研究报告书.doc
- 基于微信的生活服务平台的设计与实现毕业设计 信息科学与技术学院.doc
- 基于慧鱼模型搭建的自动门设计及其控制电路设计【精品论文】.doc
- 基于提升职工素质的ovm培训体系设计论文2011年12月.doc
- 基于我国高铁客运市场需求分析的高铁服务营销产品和流程设计_硕士论文北京交通大学.doc
- 基于改进遗传算法的复杂网络路径优化问题毕业设计说明书天津理工大学.doc
- 基于攀钢轨梁厂43kgm重轨产品设计毕业论文攀枝花学院.doc
- 基于改进型Smith控制的加热炉温度控制系统设计_毕业设计说明书2011年6月.doc
- 基于数字图像的矩形芯片定位方法研究与实现毕业设计论文【32p】.doc
- 基于数字图像的车牌识别毕业设计论文【精编】.doc
最近下载
- (2024秋新版)人教版七年级数学上册全册PPT课件.pptx
- dixell帝思 xc15cx-xc35cx 调试维修参数设置资料.pdf
- transcad交通需求模型手册_chapter12公交分配.pdf VIP
- 高校后勤餐饮经营发展探究——以浙江树人大学为例.pdf VIP
- 幼儿园教室环创培训.pptx VIP
- 2023辽宁沈阳市铁西区面向全区招聘社区残疾人工作专职干事8人考试备考题库及答案解析.docx VIP
- 2025年安徽省池州市辅警协警笔试笔试预测试题(附答案).docx VIP
- 《追求理解的教学设计》读书心得.docx VIP
- 糖皮质激素诱导骨质疏松诊治专家共识.pptx VIP
- 2025内蒙古巴彦淖尔市能源(集团)有限公司第二批招聘55人笔试模拟试题及答案解析.docx VIP
文档评论(0)