- 3
- 0
- 约2.35千字
- 约 5页
- 2024-03-22 发布于中国
- 举报
相似重复记录检测的特征优选策略探究
摘要:信息时代的来临,对大数据的检测和识别提
出更高的要求,如检测精度更高和检测代价低廉。而传统的
重复记录检测方法其特征属性繁多,数据源组成更为繁琐,
导致检测精度不足和检测代价高昂问题的出现。为此,本文
探索分析了相似重复记录检测的特征优选方案,从分组模糊
聚类的原理出发,对相似重复几率的组内计算方法进行剖
析,探究其在大数据集中检测精度和识别认识方面的优势。
关键词:特征优选;相似重复记录;模糊聚类;相似度;
策略
依据相关的研究文献,可以发现传统重复记录检测方法
基于排序和组合的思想,对大数据进行识别和检测,如优先
队列技术、两字符串距离指标计算技术、数据清洗识别技术、
滑动窗口技术等。所有这些重复记录检测技术的原理基本一
致,在实际应用中存在检测精度不足且实施检测的成本高
昂。如优先队列技术在应用过程中筛选具有代表性的记录能
力不足;滑动窗口技术是基于相似重复记录的传递性基础上
导致检测精确度不足等等。面对传统相似重复记录检测方法
的不足和漏洞,一种的新的基于分组模糊聚类的记录特征属
性优选方法表现出其具有非常强的优势和弥补性。此种方法
基于模糊聚类压缩记录的基础上,对组内具有代表性的记录
进行筛选,利用组内相似度比较的算法
原创力文档

文档评论(0)