不同情境下中文文本分类模型的表现及选择.docxVIP

  • 22
  • 0
  • 约5.24千字
  • 约 9页
  • 2021-03-21 发布于天津
  • 举报

不同情境下中文文本分类模型的表现及选择.docx

不同情境下中文文本分类模型的表现及选择 摘要:针对中文文本分类任务中 N-Gram,素贝叶斯、 K最近邻和TF-IDF等经典而广泛使用的文本分类模型的选择 困惑问题,基于万余篇中文新闻文本语料数据,设计了一系 列的对比实验,考察了各模型在不同参数、不同训练数据规 模、不同训练文本长度、类别是否偏斜等多种情境下分类性 能的表现,总结了各模型的特性,为中文文本分类模型的选 择和应用提供了实践依据和参考。 关键词:中文文本;文本分类;数据挖掘;情报分析 中图分类号: TP274; TP302 文献标识码: A 文本挖掘是语言学、统计学以及计算机技术相结合的产 物,是对海量文本信息进行自动处理,获取人们感兴趣的、 隐含的、有用信息的过程,在信息检索、生物医学、情报获 取、舆情分析和市场营销等众多领域备受关注。文本分类作 为文本挖掘领域中的核心技术,是各种自然语言处理、应用 的基础。其中分类模型的选择对最终结果具有至关重要的影 响。然而,因所基于的原理、参数、应用场合各不相同,即 使相同的模型其性能表现也往往大相径庭。 新闻文本是一类常见的文本形式,其蕴含的信息量大, 是各种情报分析的重要数据源。尽管现有的各个新闻网站以 栏目形式对新闻进行了人工划分,然而各网站的分类体系和 栏目形式各不相同,因此在具体的新闻挖掘应用项目中,常 需将采集的新闻数据重新进行组织和划分。中文文本分类领 域中具有代

文档评论(0)

1亿VIP精品文档

相关文档