基于模板的网页数据抽取系统实现.pptVIP

  • 3
  • 0
  • 约5.37千字
  • 约 26页
  • 2019-01-06 发布于湖北
  • 举报
基于模板的网页数据抽取系统实现 指导教师:杜小勇教授 05级计算机科学与技术 康菁菁 2009.5.8 提纲 开发背景 系统体系结构 网页抓取 数据抽取 关键技术 系统贡献 未来工作 提纲 开发背景 系统体系结构 网页抓取 数据抽取 关键技术 系统贡献 未来工作 开发背景 课题组任务 构建法学知识检索系统 开发任务 实现HTML网页抓取和数据抽取系统 为法学检索系统提供互联网上的语料支持 思路:基于模板的网页数据抽取 网页的通用特性 同一网站中网页的结构,往往被数量很少的固定模板承载 网页内容可能会更新,其模板却相对可靠稳定 基于模板的网页数据抽取 对特定的网页配置抽取模板 在模板中定位需要提取的信息 使用模板的优点 网页通过模板然后转化为结构化数据, 网页格式的变化不需要修改抽取系统的代码 提纲 开发背景 系统体系结构 网页抓取 数据抽取 关键技术 系统贡献 未来工作 系统架构 网页抓取 扩展开源爬虫的功能 数据抽取 使用XSL模板抽取数据 网页抓取:开源爬虫ItSucks的扩展 ItSucks爬虫:Java Web Spider开源项目 下载规则:通过下载模板、正则表达式定义 网页存储:镜像形式 扩展爬虫的链接抽取功能 HTMLParser工具包:网页解析器 提高解析正确率、可解析含中文的链接 网页抓取 定义下载模板 配置: URL 路径 连

文档评论(0)

1亿VIP精品文档

相关文档