- 8
- 0
- 约4.16千字
- 约 4页
- 2018-11-19 发布于浙江
- 举报
搜索引擎中PageRank算法的研究
摘要 随着Internet的不断发展,Web已经成为人们的重要信息来源,为人们提供了丰富的信息资源。与此同时,它所具有的海量数据、复杂性、极强的动态性和用户的多态性等特点也给Web资源的发掘造成了相当的难度。因此,将数据挖掘技术和Web结合起来,进行Web数据挖掘也就随之成为了解决Web挖掘问题的重要途径。通过对经典的Web结构挖掘算法PageRank的研究学习,集中研究了该算法的形成思路、计算方法,并分析该算法在独立网站、包含索引页面、包含入站链接和出站链接等几种模型下的效果,提出了相应的优化策略。
关键词 Web结构挖掘,搜索引擎,PageRank
1 引 言
近20年来Internet得到了突飞猛进的发展,每天全球都有成千上万台的主机连入Internet,网络规模急剧膨胀。根据中国互连网络信息中心于2007年1月发布的《中国互联网络发展状况统计报告》显示,截至2006年12月底,我国内地网民数量已达到1.37亿,上网计算机达到5940万台,我国网民总数的快速增长已被世界所瞩目。在短短的二十多年左右的时间,人类至少产生了120亿网页,而人类有文字以来的上万年里产生了大约1亿本书:中国互联网至2006年底大致有44.7亿网页,而中华民族有史以来出版的书籍大约不过275万种。尽管书籍的内容和质量是一般网页不可比的,但在对应的时间背景
原创力文档

文档评论(0)