文本挖掘(Text Mining)技术基础.ppt

文本挖掘(Text Mining)技术基础 ;议题;搜索引擎技术不单纯只是搜索;Google的十大核心技术;搜索引擎技术使用场景:内容相似度;搜索引擎技术使用场景:内容分类、聚类;通用搜索引擎系统流程 ;Lucene 系统架构;Lucene 系统架构;搜索引擎中文本挖掘典型问题;信息检索模型;信息检索模型;信息检索模型的分类;布尔模型(Boolean Model);布尔模型的优缺点;概率模型;概率模型优缺点;词频(TF)、文件频率(DF);TF(Term Frequency):;IDF(inverse document frequency);TF-IDF;TF-IDF的例子;向量空间模型 VSM(Vector Space Model);文档-索引词词矩阵(Doc-Term Matrix);向量表示;相似度计算;向量相似度算法;文档相似性;Vector Space Model;向量空间模型例子;Inverted Files;Inverted Files;Word-Level Inverted File;In Lucene, a TermFreqVector is a representation of all of the terms and term counts in a specific Field of a Document instance As a tuple: t

文档评论(0)

1亿VIP精品文档

相关文档