基于LSH的Web数据相似性查询研究-计算机软件与理论专业论文.docxVIP

  • 7
  • 0
  • 约12.13万字
  • 约 130页
  • 2018-12-21 发布于上海
  • 举报

基于LSH的Web数据相似性查询研究-计算机软件与理论专业论文.docx

基于LSH的Web数据相似性查询研究-计算机软件与理论专业论文

摘要 随着Web技术的发展及其广泛应用,Web上涌现了海量的、格式繁多的数 据。对这些数据的查询和管理成为Web应用的重要步骤。其中,相似性查询作为 人们获取信息的重要手段,是Web数据管理的重要应用之一。w曲数据和应用 的多样性使得Web数据相似性计算也是多样化的。同时,Web数据的高维性给 其相似性查询带来了新的挑战。为了平衡查询效率和查询效果,人们提出了相似 性近似计算方案。位置敏感哈希(Locality Sensitive Hashing,LSH)作为相似性近 似计算的最新技术,获得了广泛的研究并使用于诸多相似性查询的应用中。 本文首先根据类型对Web数据进行了分类,综述了位置敏感哈希(Locality Sensitive Hashing,LSH)技术的研究现状,针对Web数据的特点和Web数据管理 的挑战,本文使用位置敏感哈希技术对Web上的数据在以下三个方而进行了研 究:在Hadoop平台上研究了大规模XML数据结构相似性查询:对于字符串数 据,研究了基于Hash的字符串相似性连接;对文本数据相似性查询,提出了基 于学习的相似性查询框架和算法。本文的主要贡献总结如下: 1.在Hadoop平台上研究了大规模XML数据结构近似相似性查询。首先我 们研究了XML树结构相似性计算、Hadoop集群的编程模式,接着研究了 XML树结构信息提取技术Pq.gram,并使用Pq.gr

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档