- 1
- 0
- 约9.06千字
- 约 6页
- 2023-04-20 发布于北京
- 举报
网络爬虫技术研究
: 达 学号: 班级: 科研团队:信通院 组
一、起始
随着网络的迅速发展, 网成为大量信息的载体,如何有效地提取并利用这些信息成
为一个巨大的 。搜索引擎,例如传统通用的搜索引擎AltaVista ,Yahoo!和 等,作
为一个辅助人们检索信息的工具成为用户 网的 和指南。但是,这些通用性搜索
引擎也存在着一定的局限性,如:不同领域、不同背景的用户往往具有不同的检索目的和需
求,通用搜索引擎所返回的结果包含大量用户不关心的网页。通用搜索引擎的目标是尽可能
大的网络覆盖率,有限的搜索引擎服务器资源与无限的网络数据资源之间的 将进一步加
深。 网数据形式的丰富和网络技术的不断发展, 、数据库、音频、 多 等不
同数据大量出现,通用搜索引擎往往对这些信息含量密集且具有一定结构的数据 为力,
不能很好地发现和获取。通用搜索引擎大多提供基于关键字的检索,难以支持根据语义信息
查询。
为了解决上述问题,定向抓取相关网页资源的聚焦爬虫应运而
原创力文档

文档评论(0)