基于分布式数据库的全文搜索系统1.docx

PAGE 13 基于分布式数据库的全文搜索系统 目录 TOC \o 1-3 \h \z \u 前言 3 设计思想 3 分布式表设计 3 ? 架构 5 文档索引过程: 6 1、多线程下载过程: 6 2、多线程分析存储 7 文档搜索过程: 7 例子 8 例子假设以下信息 8 索引 9 搜索 11 前言 开源的全文搜索项目中,lucene应该是最流行的,实际项目中必须是多个lucene共同提供服务,所以在lucene之上,分布式的全文搜索项目(如solr, elastic search)大展拳脚。 但它们有个缺点,将文档和文档生成的单词信息放在同一个lucene中,即使用相同的存储分布策略,搜索的时候,由于用户输入的是或者单词的组合,所以需要到所有的节点上去搜索才能得到完整的结果。 基于此,文档和单词信息的存储分布策略需要调整, 文档和单词信息使用独立的存储分布策略,经过探索,基于分布式数据库的全文搜索系统应运而生,即系统核心是使用分布式数据库代替基于lucene来实现存储。 设计思想 使用分布式数据库存储数据,而非lucene,主要包含用于存储文档的文档表,存储文档经过分析之后的单词表,存储单词基本信息的语料库表 文档表和单词表使用不同的均衡字段实现精确定位,文档表使用文档id,单词表使用单词i

文档评论(0)

1亿VIP精品文档

相关文档