搜索引擎蜘蛛算法与蜘蛛程序构架.docxVIP

  • 4
  • 0
  • 约3.65千字
  • 约 5页
  • 2021-12-09 发布于北京
  • 举报
搜索引擎蜘蛛算法与蜘蛛程序构架 一、网络蜘蛛基本原理 网络蜘蛛即 Web Spider,是一个很形象的名字。把互联网比喻成一个蜘蛛网, 那么 Spider 就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。 对于搜索引擎来说,要抓取互联网上所有的网页几乎是不可能的,从目前公布的数据来看,容量最大的搜索引擎也不过是抓取了整

文档评论(0)

1亿VIP精品文档

相关文档