基于lucene的搜索方案Lucene 简介.docxVIP

  • 2
  • 0
  • 约5.55千字
  • 约 12页
  • 2015-11-24 发布于江西
  • 举报
基于lucene的搜索方案Lucene 简介.docx

基于lucene的搜索方案 Lucene 简介 Lucene是apache的一个顶级开源项目,由java实现的全文检索引擎,能基于各种文档格式的全文索引和检索,包括word、pdf,不包括图形类。 L 是C#版的lucene 是由java的lucene翻译过来的,也被apache列为开源项目对外发布,功能和java的基本一样,但是由于缺乏良好的技术支持和社区活跃度,目前已被apache放入孵化器 Lucene写入:源文件经过analyzer处理,包括分词,权重处理、生成document记录,写入存储器(硬盘或者内存)。 Lucene 读出:对搜索关键词进行analyzer处理,包括分词、权重、范围匹配处理.源码结构图如下: 具体流程如下图: 数据流图如下: 二、常用推荐引擎算法问题 采用基于数据挖掘的算法来实现推荐引擎是各大电子商务网站、SNS社区最为常用的方法,推荐引擎常用Content-Based 推荐算法及协同过滤算法(Item-Based 、User-based)。但从实际应用来看,对于大部分中小型企业来说,要在电子商务系统完整采用以上算法还有很大的难度。 1)、相对成熟、完整、现成的开源解决方案较少 粗略分来,目前与数据挖掘及推荐引擎相关的开源项目主要有如下几类: 数据挖掘相关:主要包括Weka、R-Project、Knime、RapidMiner、Orange 等 文

文档评论(0)

1亿VIP精品文档

相关文档