解放军电子工程学院网络工程系.pptVIP

  • 19
  • 0
  • 约1.01千字
  • 约 13页
  • 2019-03-29 发布于天津
  • 举报
SEWM2007中文网页分类 系统说明 刘金红、孙宏纲、施凡、李军杰、赵亭 解放军电子工程学院网络工程系 概 要 系统结构与工作流程 系统模块及主要算法 系统运行环境 总结和展望 一、系统的结构 系统整体结构图 系统工作流程图 二、系统模块及主要算法 网页预处理模块 中文分词模块 文本分类模块 网页预处理模块 网页净化模块 对训练集、CWT20G文件进行解压,得到两个网页文档集合:11类别训练集和待分类网页集,对网页进行净化主要包括以下几部分: (1)根据网页中超链接在某一块中的出现比率去除网页导航条信息; (2)利用关键词构造正则表达式来去除广告栏信息和版权信息; (3)去掉无用的HTML语法标签信息。 元数据抽取模块 抽取网页标题(titile)、关键词(keywords)和网页描述(description)等元数据;基于JTidy去除Html标签和抽取网页的主体文本(body)内容。 中文分词模块 基于逆向最长匹配的分词算法 穷尽式名词短语识别算法 主要思想是,在分词的基础上,进一步找出所有的名词和名词性短语; 目的是为了构建规则分类器。 去除停用词 根据实词词典和停用词词典,去除虚词和停用词,超高频词与超低频词在文本表示模块中去除。 文本分类模块 基于规则的分类器 由机器自动完成对分类析取规则集的学习。每一条规则由名词或名词短语构

文档评论(0)

1亿VIP精品文档

相关文档