数据湖分析之Upsert功能详解.pdf

数据湖分析之Upsert功能详解 技术创新,变革未来 目录 •传统数仓入库痛点 •新一代数据湖技术 •下一步展望 传统数仓数据入库痛点 典型场景:业务数据(SQL/NoSQL)全量入库 • 典型T+1方案,数据延迟大 • 全量扫瞄源库 ,给源库造成压力,同时浪费计算和存储资源。例如使用Sqoop • 限制:源库信息变更不能同步到数仓 ,例如 :Schema变换 传统数仓数据入库痛点 改进的场景:CDC导入到Kafka再导入到HBase, Kudu • HBase, Kudu无法存储全量数据,需要再次导入到Hive库分析 • 整个流程需要多个组件联动,部署复杂 • 限制:仍然无法解决数据Schema变动情况 腾讯大数据TDW入库 腾讯大数据场景:TDBANK入库 • 消息分拣层分拣消息落地成HDFS文件,定时启动Hive任务进行入库操作 • 数据延迟依赖于定时任务,以及Hive入库Job运行情况 • 无法处理延迟到达数据,延迟到达数据重新入库导致数据丢失 新一代数据湖技术 全新的数据入湖方式 CDC 新一代数据湖Upsert技术优势 ACID Snapsh

文档评论(0)

1亿VIP精品文档

相关文档