机工社课件Python商务大数据分析与应用第14章 文本挖掘.pptxVIP

  • 1
  • 0
  • 约8.86千字
  • 约 111页
  • 2026-09-01 发布于广东
  • 举报

机工社课件Python商务大数据分析与应用第14章 文本挖掘.pptx

BUSINESSANALYSISANDMINING第14章文本挖掘主讲老师:李丹丹

目录文本挖掘流程NLTKTextBloieba050607SnowNLP词云LDA主题模型

BUSINESSANALYSISANDMINING14.1文本挖掘流程

文本挖掘流程文本挖掘一般包括下面几个步骤:1)定义问题:明确需要研究的问题。2)获取数据:包括公开数据集(标准数据、有一些是已经清洗干净)、公有数据(开放数据,比如政府开放数据项目,各非营利性组织提供)、私有数据(企业、组织内部数据,比如求助信息语料)、互联网抓取的数据(数据采集)等。3)数据预处理:清除HTML标签、处理编码问题、分词数据清洗,如:去标点、拼写纠错、大小写规范化、去停用词、词根化、词性标注等。4)文本特征处理:词袋模型、N-Gram、TF-IDF等。5)模型训练:常用机器学习模型,如逻辑回归、朴素贝叶斯、随机森林、神经网络等。6)分析结果展示:词云、词频统计图等各类可视化方案。

BUSINESSANALYSISANDMINING14.2NLTK

NLTKNLTK是Python中常用的自然语言处理工具的组合包,包含大量的模块、数据以及文档资源。NLTK支持利用Python构建一整套英文文本处理的产品,整个工具包基本覆盖自然语言处理的核心任务,包括文本分词、词根化、词性标注、标签

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档