一种基于标点密度的网页正文提取方法.docVIP

  • 17
  • 0
  • 约6.86千字
  • 约 11页
  • 2018-08-14 发布于湖北
  • 举报

一种基于标点密度的网页正文提取方法.doc

一种基于标点密度的网页正文提取方法   摘 要:本文提出了一种基于DOM树的正文提取方法。该方法是在基于DOM树的文本密度的正文提取算法的框架上改进而来的。基于对文言文翻译网站的观察,本方法使用标点符号密度取代原方法的文本密度。通过随机选取50篇文言文翻译网页作为测试集,本文提出的方法获得了更好的准确率、召回率和F值。   关键词:DOM;标点密度;文本密度;正文提取   中图分类号:TP312 文献标识码:A 文章编号:2095-2163(2015)04-   A Method of Webpage Content Extraction based on Point Density   YANG Qin, YANG Muyun   (School of Computer Science and Technology, Harbin Institute of Technology, Harbin 150001, China)   Abstract: This paper proposes a DOM based content extraction method. It is improved from the DOM based content extraction via text density. Based on the observation of cla

文档评论(0)

1亿VIP精品文档

相关文档