- 16
- 0
- 约5.01千字
- 约 74页
- 2022-06-29 发布于江苏
- 举报
文本挖掘;2021/12/16;在网络普及的时代,Web页面、新闻消息、电子邮件、研究论文、书籍、数字图书馆等都包含了大量的文本信息,这些文本信息构成了粗糙的非结构化文本数据。
在现实世界中,可获取的大部信息是以文本形式存储在文本数据库中的,由来自各种数据源的大量文档组成。由于电子形式的文本信息飞速增涨,文本挖掘已经成为信息领域的研究热点。
;2021/12/16;2021/12/16;6;7;——网络舆情监控;9;10;11;12;13;——电子商务网站;2021/12/16;;1.获取文本
现有文本数据导入,或者通过如网络爬虫等技术获取网络文本,主要是获取网页HTML的形式。
2.剔除噪声文档
剔除噪声文档以改进挖掘精度,或者在文档数量过多时仅选取一部分样本以提高挖掘效率.
例如网页中存在很多不必要的信息,比如说一些广告,导航栏,html、js代码,注释等等并不需要的信息,可以删除掉。;3.文本的语言学处理
(1)分词
分词就是将连续的字序列按照一定的规范重新组合成词序列的过程。
;1.最大匹配法(Maximum Matching method, MM法):选取包含6-8个汉字的符号串作为最大符号串,把最大符号串与词典中的单词条目相匹配,如果不能匹配,就削掉一个汉字继续匹配,直到在词典中找到相应的单词为止。匹配的方向是从右向左。
2.逆向最大匹
原创力文档

文档评论(0)