相似重复记录检测的特征优选策略探究.pdfVIP

  • 3
  • 0
  • 约2.35千字
  • 约 5页
  • 2024-03-22 发布于中国
  • 举报

相似重复记录检测的特征优选策略探究.pdf

相似重复记录检测的特征优选策略探究

摘要:信息时代的来临,对大数据的检测和识别提

出更高的要求,如检测精度更高和检测代价低廉。而传统的

重复记录检测方法其特征属性繁多,数据源组成更为繁琐,

导致检测精度不足和检测代价高昂问题的出现。为此,本文

探索分析了相似重复记录检测的特征优选方案,从分组模糊

聚类的原理出发,对相似重复几率的组内计算方法进行剖

析,探究其在大数据集中检测精度和识别认识方面的优势。

关键词:特征优选;相似重复记录;模糊聚类;相似度;

策略

依据相关的研究文献,可以发现传统重复记录检测方法

基于排序和组合的思想,对大数据进行识别和检测,如优先

队列技术、两字符串距离指标计算技术、数据清洗识别技术、

滑动窗口技术等。所有这些重复记录检测技术的原理基本一

致,在实际应用中存在检测精度不足且实施检测的成本高

昂。如优先队列技术在应用过程中筛选具有代表性的记录能

力不足;滑动窗口技术是基于相似重复记录的传递性基础上

导致检测精确度不足等等。面对传统相似重复记录检测方法

的不足和漏洞,一种的新的基于分组模糊聚类的记录特征属

性优选方法表现出其具有非常强的优势和弥补性。此种方法

基于模糊聚类压缩记录的基础上,对组内具有代表性的记录

进行筛选,利用组内相似度比较的算法

文档评论(0)

1亿VIP精品文档

相关文档