专题型网页发现以与网页内信息块发现.pptVIP

  • 1
  • 0
  • 约3.11千字
  • 约 24页
  • 2017-05-10 发布于四川
  • 举报

专题型网页发现以与网页内信息块发现.ppt

专题型网页发现以与网页内信息块发现

主题型网页发现以及网页内信息块发现 华南理工大学 广东省计算机网络重点实验室 成员:蔡捷飞、陈啟泓、梁志宏、马亮、温泽逢 主题型网页发现 目录 特征分析 算法设计 结果分析 不足与改进 特征分析 主题型网页特征: 文字较多(非锚文本) 主题型网页一般都有明显的文本段落,文字较多,相应的标点符号也较多。 URL较长 在一般的Web网站链接导航树上,主题型网页主要分布于底层,多为叶节点。对于同一网站而言,主题型网页的URL相对较长。URL体现了网站内容管理的层次,对于大型网站而言,URL往往非常有规律。 链接较少 主题型网页的主体在于“文字”,相对于导航型网页,其链接数较少。 特征分析 非主题型网页特征 文字较少 非主题型网页的主体是链接,图像,或者其它形式的内容,文字较少 链接较多 对于导航型网页而言,链接是其主要内容 URL较短 导航型网页的URL层数较少,且多为目录型URL 特征分析 网页噪音特征 多以链接的形式出现 有很多锚文本,但标点符号较少 有许多常见的噪音文本,如版权声明等 在视觉上,多出现于网页的边缘 算法设计 主题型网页发现:对网页进行二元分类 分类过程分为三个阶段: 阶段1: 根据主题型网页的重要特征进行分类,这些重要特征主要包括:标点符号数目,文字数目。无需复杂算法,只需设置特征阈值。 阶段2: 对在阶段1中无法确定分类的网页,提取更多

文档评论(0)

1亿VIP精品文档

相关文档