数据抽取中文本分类研究和探究.docVIP

  • 4
  • 0
  • 约2.9千字
  • 约 6页
  • 2017-12-03 发布于福建
  • 举报
数据抽取中文本分类研究和探究

数据抽取中文本分类研究和探究   【摘 要】在数据抽取中,主要是对文本的处理。文本分类是文本处理的基本过程。文本分类技术同时还在自然语言处理、信息检索、文本挖掘等领域都有着广泛的应用。经过分类后的文本可以减少用户甄别信息时间,满足不同用户需求,发挥信息自身其最大使用价值。 【关键词】向量;信息增益;特征项 0 引言 Web信息抽取技术可以大大的缩短人们对资料的整理时间,为信息检索提供方便,有利于现实文档的存档管理。而Web信息抽取技术所抽取的内容主要为文本,不断迅速发展的互联网可以被看作是十分巨大的文档库,大量的文档信息通常分散存放在不同网站上,它们具有不同的表现形式。为实现数据抽取,首要任务是需要将文本分类处理。 1 文本的表示方法 普通的文本是无结构的,为了让计算机分析它们所属的类别,需要将文本转化成可被处理的结构化形式,目前应用最广泛方法的是向量空间模型,基本思想是把文档表示向量空间中的一个向量。特征项必须具备一定的特性: 1)特征项要能够准确标识文本内容,表征文本的主题信息; 2)特征项具有将目标文本与其他文本相区分的能力; 3)特征项的在数量上不能太多,且出现频率适中; 4)特征项要容易从文本中分离,具有明确的语义。 在中文文本类中最常用的是采用词语作为文本的特征项。词语有几个优点:相对于字具有更强的语义信息歧义

文档评论(0)

1亿VIP精品文档

相关文档