数据立方与Hadoop生态圈
数据立方与 Hadoop生态圈
数据立方提供了结构化数据的海量存储和实时在线查询功能, 在整个生态圈 中与HBase具有相同的地位。不同的是数据立方提供了多维度的实时查询, 下图 为整个生态圈的结构。
FW■MahoutHive数据挖掘数据仓库
F
W
■
Mahout
Hive
数据挖掘
数据仓库
且
■
F
MapReduce 分布式计算
r
Hbase
NoSql^j?据库
— 收匚 3
数据立方实时、分布式、高维数据库
HD已大数据分布式文件系统
分布式协作服务
在传统的Hadoop生态圈中,主要解决的问题是大数据的存储、检索以及分 析。对于数据的存储一般采用HDFS乍为底层的分布式文件系统,随着HDFS版本 的不断升级,目前Hfds基本趋向于稳定。而数据存储一般采用 HBase乍为结构 化数据存储,对于海量数据的分析采用Map Reduce Mahout提供了对大数据的数 据挖掘功能,免去了我们自己编写分布式程序的问题。 同时提供的其他组件也很
方便的给开发者提供快捷的开发。
数据立方与HDFS
数据立方作为大数据的存储,底层采用了 HDFS乍为底层的存储。这样可以
很大程度上避免对于文件可靠性、数据一致性等存储问题
数据立方与HBase
HBase乍为目前开源的NoSql,可以提供结构化的数据存储以及基于 RowKey 的实时查询业务
原创力文档

文档评论(0)