自然语言处理面试题及答案.docxVIP

  • 4
  • 0
  • 约5.19千字
  • 约 5页
  • 2025-10-04 发布于河北
  • 举报

自然语言处理面试题及答案

一、基础概念题

问题:请解释词向量(WordEmbedding)和One-Hot编码的区别,实际场景中更倾向用哪种?为什么?

答案:One-Hot是把每个词对应成一个“只有该词位置为1,其他全为0”的向量,比如“猫”在词典中排第5,向量就是[0,0,0,0,1,0,...]。它的问题很明显,一是词典大了向量会特别稀疏(比如10万词的词典,向量长度就10万),二是完全没体现词的语义关联(“猫”和“狗”的向量点积为0,看不出都是动物)。

词向量是把词映射到低维稠密向量(比如100维、300维),比如“猫”可能是[0.2,-0.5,0.1,...],“狗”的向量会和它很接近,能体现语义相似度。实际场景里基本都用词向量,比如做文本分类、机器翻译时,用Word2Vec、GloVe或者预训练模型(如BERT)的词向量,能让模型更好捕捉语义,训练效率也更高。

问题:什么是BLEU值?它在NLP中用来做什么?使用时要注意什么局限?

答案:BLEU是评估机器翻译、文本生成结果的常用指标,核心是看模型生成的句子和人类写的“参考句”重合度有多高,主要算“n-gram(连续n个词)的匹配率”。比如生成句是“我吃饭”,参考句是“我吃米饭”,1-gram匹配“我”“吃”,2-gram匹配“

文档评论(0)

1亿VIP精品文档

相关文档