一种基于数据驱动型Web页面的信息抽取方法.docVIP

  • 5
  • 0
  • 约4.96千字
  • 约 9页
  • 2018-08-14 发布于湖北
  • 举报

一种基于数据驱动型Web页面的信息抽取方法.doc

一种基于数据驱动型Web页面的信息抽取方法   摘 要:提出了一种以XSLT为抽取规则的Web信息抽取方法。首先将样本Web文档转换为XHTML文档,通过解析器构造DOM树,寻找最大频繁子树并识别出用户感兴趣信息,以此形成需抽取内容的定位信息。然后对不同样本Web文档的定位信息进行归纳学习,并构造出以XSLT文档表示的抽取规则。最后应用该抽取规则进行实际的信息抽取。方法基本不需要人工干预即可完成Web信息抽取,可应用于Web数据挖掘以及信息搜集比对等应用领域。   关键词:Web;抽取;XML;XSLT   Extracting Information of Web based on Data Driver   LIU Hongyi   (College of the PLA border denfense academy of fighting Lab,Xian,China,710108)   Abstract: This paper presents a method of information extraction using XSLT as extracting rules. First, change the sample Web document into XHTML document, constructs DOM tree by the parser

文档评论(0)

1亿VIP精品文档

相关文档