数据湖分析之Upsert功能详解
技术创新,变革未来
目录
•传统数仓入库痛点
•新一代数据湖技术
•下一步展望
传统数仓数据入库痛点
典型场景:业务数据(SQL/NoSQL)全量入库
• 典型T+1方案,数据延迟大
• 全量扫瞄源库 ,给源库造成压力,同时浪费计算和存储资源。例如使用Sqoop
• 限制:源库信息变更不能同步到数仓 ,例如 :Schema变换
传统数仓数据入库痛点
改进的场景:CDC导入到Kafka再导入到HBase, Kudu
• HBase, Kudu无法存储全量数据,需要再次导入到Hive库分析
• 整个流程需要多个组件联动,部署复杂
• 限制:仍然无法解决数据Schema变动情况
腾讯大数据TDW入库
腾讯大数据场景:TDBANK入库
• 消息分拣层分拣消息落地成HDFS文件,定时启动Hive任务进行入库操作
• 数据延迟依赖于定时任务,以及Hive入库Job运行情况
• 无法处理延迟到达数据,延迟到达数据重新入库导致数据丢失
新一代数据湖技术
全新的数据入湖方式
CDC
新一代数据湖Upsert技术优势
ACID Snapsh
您可能关注的文档
最近下载
- 钢-混组合梁专题培训讲义-日本钢桥构造细节设计指南(翻译资料.pdf VIP
- 复习:人教版小学数学一升二暑假作业天天练(第2天)(含答案).docx VIP
- IPC-1602-CN:2020+印制板操作和储存标准+-+完整中文电子版(36页).pdf VIP
- GB 150.1-2011 压力容器 第1部分:通用要求.docx VIP
- CPCA1201-2009印制板的包装、运输和保管.pdf VIP
- 一种彩虹膜分配器.pdf VIP
- 经典散热原理课件.ppt VIP
- 06CJ05 蒸压轻质砂加气混凝土(AAC)砌块和板材建筑构造 .docx VIP
- 《数字贸易学》教学大纲、二维码试题及答案.pdf VIP
- 工业建筑防腐蚀设计标准.docx VIP
原创力文档

文档评论(0)