- 4
- 0
- 约2.82万字
- 约 34页
- 2018-11-03 发布于福建
- 举报
一种可扩展高效链接提取模型实现与验证
摘要
随着WWW(World Wide Web)越来越广泛的发展与应用,搜索引擎已经成为人们从中查找信息的重要工具;在搜索引擎的系统实现中,如何通过链接提取发现更多更广的Web资源又是影响搜索引擎性能的重要因素之一。
本文总结了设计链接提取模块所要求的“容错性”、“正确性”、“全面性”、“高效性”和“可扩展性”等五个目标,并从这些角度去分析传统的链接提取方法的不足,并作为改进,提出了一种新的设计思路。
本文将链接提取的过程划分为信息提取,信息加工,信息分析以及信息储存四个过程来进行研究。信息的获取通过HTML文法分析方法从文档中得到初始URI(Uniform Resource Indetifier)数据;信息加工阶段通过运用URI解析算法对初始数据进行精练;然后在信息分析过程中进一步地筛选与过滤;最后将结果存储在一个双链表结构中。
基于上述方法,本文实现了一个新的链接提取模型,并将该模型运用于北京大学天网WWW搜索引擎;在获得足够的实验数据之后,全面的比较了这种新的链接提取模式与传统方法在各项指标上的优劣。结果表明该模型有明显的优势。
关键字:搜索引擎,链接提取,统一资源地址(URI)
Abstract
As the World Wide Web is becoming more and more popular, search engine has become an ess
您可能关注的文档
最近下载
- 江苏师范大学成人继续教育网络课程《英语》单元测试及参考答案.docx VIP
- 数学教案_小学数学教案.docx VIP
- MESC SPE 76-210-2020-A105美国最新标准.pdf
- 小学一年级语文下册第三单元提升练习二.docx VIP
- MIDAS铁路桥梁操作实例.pdf VIP
- 道路扬尘防治施工方案.docx VIP
- 第一小学一年级语文下册 第三单元 提升练习题 新人教版一年级语文下册第三单元提升练习.doc VIP
- MIKE 2014 教程5 - MIKE 21 中的水工结构物.pdf VIP
- 工程移交清单范本 .pdf VIP
- 新时代乡镇卫生院的发展问题与解决对策.docx VIP
原创力文档

文档评论(0)