Web信息处理与应用复习笔记.PDFVIP

  • 5
  • 0
  • 约1.39万字
  • 约 10页
  • 2020-04-26 发布于天津
  • 举报
Web 信息处理与应用 复习笔记 © 2017-1 熊家靖 P PART 1:Web Search 一、Introduction 1、web 搜索的挑战: 数据规模大、分布散、不稳定、质量差、无结构、异构、价值低 2、信息检索: 给定查询和信息库,找到相关的文档 3、IR 与DB 的区别: DB 数据结构化、有明确语义,查询结构化、匹配要精确、次序不重要 IR 数据半结构化、无明确语义,查询为任意内容、无需精确匹配、次序很重要 4、IR 的任务: 基于用户查询的搜索、信息过滤、分类、问答 5、IR 的基础性问题: 相关性计算、检索模型、评价、信息需求、检索性能 二、Web Crawler 1、网络爬虫的概念: 从一个种子站点集合开始,从 web 中寻找并且下载网页,获取排序需要的相关信 息,并且剔除低质量的网页 2、网络爬虫基本过程: 种子装入桶中、每次从桶中取出一

文档评论(0)

1亿VIP精品文档

相关文档