ETL过程中的数据清洗技术研究与应用.docVIP

  • 25
  • 0
  • 约4.88万字
  • 约 57页
  • 2019-04-05 发布于江西
  • 举报

ETL过程中的数据清洗技术研究与应用.doc

沈阳航空工业学院硕士学位论文 摘要     数据的抽取、转换和装入是创建数据仓库系统的重要环节,它将组织机构内多元分 散的数据按照主题统一装载到数据仓库中,能够很好地解决组织机构内部数据一致性与 信息集成化问题。然而,ETL程序的频繁运行难免会产生大量的“脏数据”,直接导致 数据仓库技术由于数据质量而不能产生理想正确的决策分析结果,因此数据在进入数据 仓库之前需要进行清洗。数据清洗技术一直是近年来数据仓库领域中的研究热点,其主 要任务是从原始数据集中去除不一致的和错误的数据。     首先描述了数据质量的基本概念、评价指标及分类等问题,在此基础上按照数据清 洗算法将脏数据划分为“独立型脏数据”、“依赖型脏数据”两类,并给出了相应的解 决方法。其次描述了清洗的基本定义及清洗环节,定义了ETL层的数据清洗模型和在元 数据库中存储的清洗规则后,提出了一种自动清洗和人为清洗相混合的数据清洗策略.     针对中文地址类信息的数据清洗问题,提出了基于特征字符的分词方案,并给出了 相应的分词算法。该方案将中文地址类信息按逻辑意义分为省、市、区、街及数字五组 信息,通过与元数据库中省、市、区的标准信息匹配保证了分词的准确性。     针对中文地址类相似重复记录的处理问题,建立了包含分词规则的元数据库,提出 了一种相似重复检测模型,并给出了利用可变权值策略计算中文地址类信息相似度的算 法。实验结果

文档评论(0)

1亿VIP精品文档

相关文档