通用数据质量管理系统研究与设计.docx

? ? 通用数据质量管理系统研究与设计 ? ? 吴鹏 连礼泉 Summary:针对大型基层数据采集系统数据错误和数据重复的典型现实问题,研究了数据校验通用模型和基于聚类与数据质量的自动去重方法,设计了一个通用数据质量管理系统,适用于类似采集系统的普遍数据质量问题。 Key:数据质量;校验模型;聚类;自动去重 :TP311 :A :1009-3044(2018)16-0010-03 大数据时代,一个国家掌握和运用大数据的能力,成为塑造国家竞争力的战略制高点之一[1]。国家大数据战略背景下,在国家安全、社会治理和经济发展各领域形成战略性数据资源库,是奠定国家竞争优势的基础。例如在社会治理领域,以大数据思维汇聚最小社会治理单元(乡村、社区)的相关数据,既帮助基层减免层层采集、汇总、统计、上报的耗费和失真,又辅助决策层宏观掌握整体态势和微观洞悉基层具体问题,保障了政府决策科学化、社会治理精准化和公共服务高效化。基层数据的全面、完整、详实是基础,其质量问题会在大数据环境下被不断放大,但在基层却往往容易被忽视。本文以大型基层数据采集系统现实数据质量问题为出发点研究共性解决方案,旨在设计一套通用数据质量管理系统,适用于类似采集系统的普遍数据质量问题。 1 需求分析 某在建大型数据采集系统,采集信息五大类共计300余项,主要为结构化数据,运行一年以来,基层采集用户数超20万,单表数据量千万

文档评论(0)

1亿VIP精品文档

相关文档