* Hive的系统架构 ?用户接口,包括 CLI,JDBC/ODBC,WebUI ?元数据存储,通常是存储在关系数据库如 mysql, derby 中 ?解释器、编译器、优化器、执行器 ?Hadoop:用 HDFS 进行存储,利用 MapReduce 进行计算 Spark SQL shark简介 Spark SQL a)shark和spark的关系相当于hive和mapreduce的关系 b)shark兼容Hive语法 c)shark比Hive快N倍,原因除了底层用的是spark之外,还有它可以缓存表 d)首先要考虑公司中为什么用hive,简单,周期短,类sql,不用写MR e)hive架构说明 database 、partition、 table、 file f)shark需要部署到每个节点,hive不用 g)shark缓存表:以java原生数组形式存储(存储高效,GC友好) h)遇到shuffle——data时需要指定reducer数量;可以使用explain看执行计划 i)shark的sql查询结果可以转换为RDD Spark SQL的系统架构 Spark SQL Catalyst是与Spark解耦的一个独立库,是一个impl-free的执行计划的生成和优化框架。 Spark SQL的优点 Spark SQL 1.?持使?hql来写查询语句,覆盖sha
原创力文档

文档评论(0)