文本挖掘介绍.pptxVIP

  • 16
  • 0
  • 约5.01千字
  • 约 74页
  • 2022-06-29 发布于江苏
  • 举报
文本挖掘;2021/12/16;在网络普及的时代,Web页面、新闻消息、电子邮件、研究论文、书籍、数字图书馆等都包含了大量的文本信息,这些文本信息构成了粗糙的非结构化文本数据。 在现实世界中,可获取的大部信息是以文本形式存储在文本数据库中的,由来自各种数据源的大量文档组成。由于电子形式的文本信息飞速增涨,文本挖掘已经成为信息领域的研究热点。 ;2021/12/16;2021/12/16;6;7;——网络舆情监控;9;10;11;12;13;——电子商务网站;2021/12/16;;1.获取文本 现有文本数据导入,或者通过如网络爬虫等技术获取网络文本,主要是获取网页HTML的形式。 2.剔除噪声文档 剔除噪声文档以改进挖掘精度,或者在文档数量过多时仅选取一部分样本以提高挖掘效率. 例如网页中存在很多不必要的信息,比如说一些广告,导航栏,html、js代码,注释等等并不需要的信息,可以删除掉。;3.文本的语言学处理 (1)分词 分词就是将连续的字序列按照一定的规范重新组合成词序列的过程。 ;1.最大匹配法(Maximum Matching method, MM法):选取包含6-8个汉字的符号串作为最大符号串,把最大符号串与词典中的单词条目相匹配,如果不能匹配,就削掉一个汉字继续匹配,直到在词典中找到相应的单词为止。匹配的方向是从右向左。 2.逆向最大匹

文档评论(0)

1亿VIP精品文档

相关文档