【自然语言处理实践01】基于统计的文本表示.pptxVIP

  • 1
  • 0
  • 约2.21千字
  • 约 13页
  • 2026-08-21 发布于山东
  • 举报

【自然语言处理实践01】基于统计的文本表示.pptx

1基于统计的文本表示

2什么是文本表示?文本表示指的是将文本信息转化为计算机可处理的形式,以便于进行文本分析、挖掘和机器学习等任务。在自然语言处理领域,文本表示是一项核心任务,因为计算机无法直接理解和处理人类的自然语言。文本表示的目标是将文本中的语义和结构信息捕捉到数值化的表示形式中,以便于计算机进行进一步的分析和推理。

3文本表示的常见形式

4独热编码——One-hot深度学习应用于自然语言处理之前,传统的词表达通常采用one-hot方式表达。杭州[0,0,0,0,0,0,0,1,0,……,0,0,0,0,0,0,0]上海[0,0,0,0,1,0,0,0,0,……,0,0,0,0,0,0,0]宁波[0,0,0,1,0,0,0,0,0,……,0,0,0,0,0,0,0]北京[0,0,0,0,0,0,0,0,0,……,1,0,0,0,0,0,0]1.向量维度取决于语料库中词数,导致维数灾难2.向量之间相互独立,看不出关联关系传统的基于规则或者基于统计的自然语言处理方法将单词看作一个原子符号。one-hot表示将词语看作一个长向量。这个向量的维度是词表大小,向量中只有一个维度的值是1,其余维度是0,这个维度就代表了当前的词;

5独热编码——One-hot缺陷总结:1.维度过高:随着词表增大,维度会越来越大2.矩阵稀疏:one-hot表示的每一个

文档评论(0)

1亿VIP精品文档

相关文档