生成式智能体政务数据自动归集清洗技术.docxVIP

  • 1
  • 0
  • 约4.39千字
  • 约 5页
  • 2026-07-26 发布于浙江
  • 举报

生成式智能体政务数据自动归集清洗技术.docx

生成式智能体政务数据自动归集清洗技术

摘要:数字政府建设加速推进,政务数据呈现出多源异构、标准不一、更新频繁及语义晦涩等特征,传统人工归集与规则清洗模式已无法支撑海量政务数据的实时治理需求。本文聚焦生成式智能体政务数据自动归集清洗技术,系统分析基于大语言模型语义理解的智能数据采集、自适应数据清洗规则生成及数据血缘追溯等核心机制。探讨从多源数据接入、智能去重融合、质量评估到自动归集入库的全流程自动化方案,旨在构建高效智能可信的政务数据治理新范式,为打破数据孤岛、释放数据要素价值提供技术支撑。

关键词:生成式智能体;政务数据;自动归集;智能清洗;数据治理

第一章政务数据禀赋特征与智能归集清洗诉求

政务数据涵盖行政审批、公共服务、行政执法及经济统计等广阔领域,其数据禀赋呈现典型的海量性、异构性与敏感性交织特征。在数据禀赋方面,数据来源极为分散,既包括结构化程度较高的业务数据库表,也包含大量半结构化报表与非结构化文档如红头文件、执法卷宗。数据标准严重不统一,同名异义、异名同义现象普遍,例如同一审批事项在不同委办局的业务系统中字段命名与数据格式迥异。数据更新频率参差不齐,部分数据实时产生,部分则长期静止。更为关键的是,政务数据涉及大量个人隐私与企业商业秘密,安全保密要求极高。在智能归集清洗诉求方面,传统数据治理高度依赖人工梳理数据字典与编写清洗脚本,面对千万级字段的海量数据,人力成本呈指数

文档评论(0)

1亿VIP精品文档

相关文档