;;;;词向量化技术;文本向量化(又称“词向量模型”、“向量空间模型”)即将文本表示成计算机可识别的实数向量,根据粒度大小不同可将文本特征表示分为字、词、句子或篇章几个层次。文本向量化的方法主要分为离散表示和分布式表示。
(1)离散表示
一种基于规则和统计的向量化方式,常用的方法包括词集模型和词袋模型,都是基于词之间保持独立性、没有关联为前提,将所有文本中单词形成一个字典,然后根据字典来统计单词出现频数,不同的是:
词集模型:例如One-HotRepresentation,只要单个文本中单词出现在字典中,就将其置为1,不管出现多少次。
词袋模型:只要单个文本中单词出现在字典中,就将其向量值加
您可能关注的文档
- 《Spark 机器学习实战》教学大纲.doc
- Spark机器学习技术及应用 课件 第1章 大数据与Spark.pptx
- Spark机器学习技术及应用 课件 第2章 Spark 3.5安装和开发环境配置.pptx
- Spark机器学习技术及应用 课件 第3章 Scala编程基础.pptx
- Spark机器学习技术及应用 课件 第4章 Spark数据结构基础.pptx
- Spark机器学习技术及应用 课件 第5章 Spark机器学习基础.pptx
- Spark机器学习技术及应用 课件 第6章 线性回归及应用.pptx
- Spark机器学习技术及应用 课件 第7章 分类算法及应用.pptx
- Spark机器学习技术及应用 课件 第8章 数据降维与应用.pptx
- Spark机器学习技术及应用 课件 第9章 聚类算法及应用.pptx
原创力文档

文档评论(0)