- 1
- 0
- 约小于1千字
- 约 10页
- 2026-08-21 发布于山东
- 举报
1基于Word2Vec的文本表示
2文本表示方法比较离散式表示(DiscreteRepresentation):One-Hot、TF-IDF、词袋模型分布式表示(DistributedRepresentation):Word2Vec缺点:无法反映单词之间的相似程度
3Word2Vec基本思想:通过训练将每一个词映射成一个固定长度的向量,所有向量构成一个词向量空间,每一个向量(单词)可以看作是向量空间中的一个点,意思越相近的单词距离越近。1.词向量中语义上相近的词距离接近2.词向量中语法上相近的词距离接近
CBOW和Skip-gram如果是用一个词的上下文作为输入,来预测这个词本身,则是『CBOW模型』如果是用一个词作为输入,来预测它的上下文词,则这个模型叫做『Skip-gram模型』
CBOWPineapplesarespikeyandyellow在CBOW模型中,我们用一个中心词在文本序列中的上下文词来预测该中心词。
CBOW模型结构:一个具有输入层、隐藏层和输出层的3层神经网络?
Skip-gram在Skip-gram模型中,我们用一个词来预测它在文本序列中周围的词。Pineapplesarespikeyandyellow
Skip-gram模型结构:一个具有输入层、隐藏层和输出层的3层神经网络?
9词向量的应用寻找相似词信息检索查询扩展知
您可能关注的文档
- 【自然语言处理实践01】基于统计的文本表示.pptx
- 【自然语言处理实践03】基于预训练的文本表示.pptx
- 【自然语言处理实践04】基于BiLSTM的文本分类.pptx
- 【自然语言处理实践05】基于Attention机制的文本分类.pptx
- 【自然语言处理实践06】基于预训练-微调的文本分类.pptx
- 【自然语言处理实践07】基于PaddleHub的低俗文本审核.pptx
- 【自然语言处理实践08】基于表示(Representation)的文本匹配.pptx
- 【自然语言处理实践09】基于交互(Interaction)的文本匹配.pptx
- 【自然语言处理实践10】基于预训练-微调的文本匹配.pptx
- 【自然语言处理实践11】基于BiLSTM-CRF的命名实体识别.pptx
原创力文档

文档评论(0)