数据湖总体发展概况及存在的问题和建议,.docxVIP

  • 11
  • 0
  • 约2.05千字
  • 约 4页
  • 2022-09-07 发布于湖北
  • 举报

数据湖总体发展概况及存在的问题和建议,.docx

大数据包括结构化、半结构化和非结构化数据,非结构化数据越来越成为数据的主要部分。据IDC的调查报告显示:企业中80%的数据都是非结构化数据,这些数据每年都按指数增长60%。[6]大数据就是互联网发展到现今阶段的一种表象或特征而已,没有必要神话它或对它保持敬畏之心,在以云计算为代表的技术创新大幕的衬托下,这些原本看起来很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值。

---------宋停云与您分享---------- ---------宋停云与您分享---------- 、 、、 数据湖总体发展概况及存在的问题和建议, 数据湖总体发展概况及存在的问题和建议, 、 0 ---------宋停云与您分享---------- ---------宋停云与您分享---------- 数据湖领域的发展历程: 想要了解一个概念,最关键的其实是明白这个概念解决了什么样 的问题。由此才能明白其中的一些设计。在过去的大数据领域中,我们借助 HDFS 完成了分布式的文件存储,MapReduce 解决了分布式的批式计算,Yarn 解决了分布式计算的资源调度问题。Hbase 解决了基本的近线的 KV 类大数据存储和访问。Hive 及其生态完成了传统数据仓库从数据库到 Hadoop 生态的迁移。Flink 以相对用户友好的方式收敛了实时数据计算。那么目前还有哪些问题没有被很好的解决呢? HDFS 不支持完整的增删改,不支持事务。虽然现有离线数仓的范式非常契合 HDFS 的 immutable 特性,但是这一特性带来了流程的冗余和成本升高,并进一步 block 了这种分布式文件存储的更多发展。实时计算和离线计算很难达成一致。由于实时计算所使用的存储和HDFS 有特性上的区别,进而导致了架构,存储,建模等方方面面的不同,所以目前批流一体都处于非常割裂得状态,大家希望能用 k

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档