- 5
- 0
- 约4.96千字
- 约 9页
- 2018-08-14 发布于湖北
- 举报
一种基于数据驱动型Web页面的信息抽取方法
摘 要:提出了一种以XSLT为抽取规则的Web信息抽取方法。首先将样本Web文档转换为XHTML文档,通过解析器构造DOM树,寻找最大频繁子树并识别出用户感兴趣信息,以此形成需抽取内容的定位信息。然后对不同样本Web文档的定位信息进行归纳学习,并构造出以XSLT文档表示的抽取规则。最后应用该抽取规则进行实际的信息抽取。方法基本不需要人工干预即可完成Web信息抽取,可应用于Web数据挖掘以及信息搜集比对等应用领域。
关键词:Web;抽取;XML;XSLT
Extracting Information of Web based on Data Driver
LIU Hongyi
(College of the PLA border denfense academy of fighting Lab,Xian,China,710108)
Abstract: This paper presents a method of information extraction using XSLT as extracting rules. First, change the sample Web document into XHTML document, constructs DOM tree by the parser
您可能关注的文档
最近下载
- 创业引导—与创业名家面对面.pdf VIP
- 黑山县越鑫水泥制品厂7.5MW分散式风电项目环境影响报告表.pdf VIP
- 抚顺市—望花区建筑垃圾转运调配场建设项目环境影响报告表.pdf VIP
- 听觉言语康复.pptx VIP
- 华南理工大学《工程力学》2023-2024学年第一学期期末试卷.pdf VIP
- 2026年初中语文《行香子》秦观田园闲适词作教案.docx VIP
- 《建筑地基基础工程施工质量验收标准》(GB 50202-2018)(完整版).docx VIP
- 2025年苏教版高中二年级碳循环实验专题试卷及解析.docx VIP
- 2025年环境影响评价师涉及持久性有机污染物项目土壤环境影响评价工作等级判定专题试卷及解析.pdf VIP
- 2025年特许金融分析师风险反转策略的构建与波动率偏斜交易专题试卷及解析.pdf VIP
原创力文档

文档评论(0)