- 1
- 0
- 约4.13千字
- 约 10页
- 2026-08-25 发布于辽宁
- 举报
2026年文本挖掘笔试题及答案
一、填空题(每题2分,共20分)
1.在文本挖掘中,_________是一种常用的文本预处理技术,用于去除文本中的停用词。
2.词袋模型(BagofWords)忽略了文本中单词的_________信息,仅考虑了单词的出现频率。
3.TF-IDF是一种常用的文本特征表示方法,其中TF表示_________,IDF表示_________。
4.文本分类中,常用的评估指标包括准确率、召回率和_________。
5.主题模型是一种用于发现文本数据中隐含主题的统计模型,其中LDA是常用的一种_________模型。
6.文本聚类中,常用的距离度量方法包括欧氏距离、曼哈顿距离和_________。
7.文本摘要生成任务的目标是将长篇文章压缩成较短的_________,同时保留原文的主要信息。
8.情感分析是一种用于判断文本情感倾向的任务,常见的情感类别包括正面、负面和_________。
9.文本生成中,常用的模型包括循环神经网络(RNN)和_________。
10.在文本挖掘中,_________是一种常用的文本预处理技术,用于将文本转换为小写形式。
二、判断题(每题2分,共20分)
1.词袋模型(BagofWords)能够保留文本中单词的顺序信息。(×)
2.TF-IDF值越高的单词,其在文档中的重要程度越高。(√)
原创力文档

文档评论(0)