大数据与数据挖掘之文本挖掘.pptxVIP

  • 2
  • 0
  • 约4.68千字
  • 约 58页
  • 2023-12-08 发布于湖北
  • 举报

大数据与数据挖掘-文本挖掘;文本挖掘背景

数据挖掘大部分研究主要针对结构化数据,如关系、事务和数据仓库数据。

现实中大部分数据存放在文本数据库中,如新闻文章、研究论文、书籍、WEB页面等。

存放在文本数据库中数据是半结构化数据,文档中可能包含结构化字段,如标题、作者、出版社、出版日期等,也包含大量非结构化数据,如摘要和内容等。;文本挖掘意在经过识别和检索令人感兴趣模式,进而从数据源中抽取有用信息。文本挖掘数据源是文本集合,令人感兴趣模

式不是从形式化数据库统计里发觉,而是从非结构化数据中发觉。;预处理

文档建模相同性计算信息检索文本分类文本聚类模型评价;把汉字汉字序列切分成有意义词,就是汉字分词,也称为切词。

“我是一个学生”分词结果是:我是一个学生。和平民主

和平、民主;和、平民、主提升人民生活水平

提升、高人、人民、民生、生活、活水、水平大学生活象白纸

大学、生活、象、白纸大学生、活象、白纸;S1=计算语言学课程是三个课时

设定最大词长MaxLen=5S2=;(1)S2=“”;S1不为空,从S1左边取出候选子串

W=计算语言学;

(2)查词表,“计算语言学”在词表中,将W加入到S2中,S2=“计算语言学/”,并将W从S1中去掉,此时S1=课程是三个课时;

(3)S1不为空,于是从S1左边取出候选子串W=课程是三个;

(4)查词表,W不在词表中,将W最右边

文档评论(0)

1亿VIP精品文档

相关文档