《文本聚类相关技术介绍概述》6100字.docxVIP

  • 1
  • 0
  • 约7.24千字
  • 约 11页
  • 2026-08-30 发布于湖北
  • 举报

《文本聚类相关技术介绍概述》6100字.docx

文本聚类相关技术介绍概述

目录

TOC\o1-3\h\u14126文本聚类相关技术介绍概述 1

14572.1文本的预处理 2

49331.1.1去除符号 2

198071.1.2文本分词 2

194531.1.3去除停用词 3

23191.1.4缺失值处理 3

102471.2文本表示模型 4

14771.2.1布尔模型 4

176691.2.2向量空间模型 5

93531.3特征选择 5

312711.3.1互信息 6

309751.3.2信息增益 6

104431.3.3卡方检验 7

210191.4特征提取 7

130521.4.1词袋模型 7

94941.4.2TF-IDF模型 8

202261.4.3t-SNE算法 8

本章主要介绍了在文本分类中常用的技术和概念知识。通关本章学习,可以更直观的理解传统的文本聚类过程和实现方式,从而更好的理解文本聚类。在此基础上,对本章的研究进行了深入的探讨。

文本分类和聚类可以被视为同一种技术手段,通过将文本数据的内部特征组合到不同的类别中。聚类是指根据“物以类聚”的原则,将没有类别的样本分为不同组的过程,这样一组数据对象被称为簇。它的目的是使来自同一簇的样本相似,而来自不同聚类的样本应该有足够

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档