基于Hudi+Flink打造流式数据湖的落地实践.pdfVIP

  • 8
  • 0
  • 约7.08千字
  • 约 31页
  • 2023-08-14 发布于广西
  • 举报

基于Hudi+Flink打造流式数据湖的落地实践.pdf

— 2023 — 基于Hudi+Flink打造流式数据湖的 落地实践 演讲人 :陈世治 bilibili 资深开发工程师 背景与挑战 典型场景案例 基建与内核 未来工作展望 背景与挑战 B站数仓当前架构与痛点 痛点 : • 批流双链路,不同的存储和计算组件, 架构负担大,维护和资源成本高 • 实链路路可观测行差,离线链路时效 不足,资源峰值效应明显 • 数据孤岛问题,在多组件间出入仓并 流转,数据管理存在断层 • 查询效率低,不依赖OLAP组件服务, 无法满足高效数据分析 数据湖能力愿景 典型场景案例 RDB一键入湖 流量 日志分流 物化查询加速 实时数仓演进 RDB一键入湖 • 背景 :业务数据入湖 ,从datax+hive方案转向cdc+hudi方案 ,提升时效性 RDB一键入湖 • 痛点 :实时入湖对以往基于批全量同

文档评论(0)

1亿VIP精品文档

相关文档