基于树编辑距离的聚类算法数据记录抽取.docxVIP

  • 2
  • 0
  • 约4.89千字
  • 约 10页
  • 2022-11-23 发布于浙江
  • 举报

基于树编辑距离的聚类算法数据记录抽取.docx

? ? 基于树编辑距离的聚类算法数据记录抽取 ? ? 宫丽娜1,祝美莲2 (1.枣庄学院,山东枣庄277160;2.中国石油大学(华东),山东青岛266580) Summary:本文研究了如何从列表页面中抽取数据记录.系统分为两个阶段:第一步采用三种启发式方法相结合的方法,识别主数据区域的根节点;第二步将数据记录分离,提出了一种新的基于树编辑距离的聚类算法,来减少候选分割方案的数量,然后根据公式计算相似度,找出最佳分割方案.本文通过对大量不同领域的网页进行测试,结果表明本文方法具有较高的准确率. Keys:主数据区域;数据记录抽取;树编辑距离;聚类算法 TP311:A:1673-260X(2013)06-0028-03 1引言 网页信息抽取为许多网络信息处理应用领域包括网络数据挖掘、网络信息检索等提供了有益的基础. 前人已经进行了很多网页信息抽取方法的研究(如[3][8];文献[1]给出了一个简短的总结).RoadRunner[2]:自动生成包装器的系统,但是它会产生一些错误的模式,准确率较低.MDR[3]方法是第一个全自动的抽取信息的算法,这种方法完全不需要用的参与.DEPTA[4]算法是MDR方法的一种改进,它假设网页中每两条数据记录之间的视觉空间都要比数据记录之间的空间大,但是这种情况并不是总是成立的.所有这些方法都具有一些缺点. 本文中,提出了一种新的自动从网页中抽

文档评论(0)

1亿VIP精品文档

相关文档