Web 数据挖掘;Outline;Why Web Mining ?; Web挖掘概述;;Web挖掘的IR和IE过程;2 web数据挖掘分类;2.1 Web内容挖掘; 2.1.2 实现方法和策略
Web内容挖掘按实现方法分为两大类:信息检索(IR)方法和数据库方法。且有两种策略:直接挖掘文档的内容和在其他工具搜索的基础上进行改进。1. 从资源查找(Information Retrival)的观点挖掘非结构化文档:
非结构化文档主要指Web上的自由文本,包括小说、新闻等。;大部分研究都是建立在词汇袋(bag of words)或称向量表示法(vector representation)的基础上,这种方??将单个的词汇看成文档集合中的属性,只从统计的角度将词汇孤立地看待,而忽略该词汇出现的位置和上下文环境。
属性可以是布尔型,根据词汇是否在文档中出现而定,也可以有频度,即该词汇在文档中的出现频率。
这种方法可以扩展为选择终结符、标点符号、不常用词汇的属性作为考察集合。;
词汇袋方法的一个弊端是自由文本中的数据丰富,词汇量非常大,处理起来很困难,为解决这个问题人们做了相应的研究,采取了不同技术,如信息增益,交叉熵、差异比等,其目的都是为了减少属性。
;一个比较有意义的方法是潜在语义索引(Latent Semantic Indexing),它通过分析不同文档中相同主题
原创力文档

文档评论(0)