结构化查询语言Spark SQL组件简介.pptxVIP

  • 3
  • 0
  • 约小于1千字
  • 约 7页
  • 2021-10-28 发布于四川
  • 举报
Spark SQL组件简介 北京信息职业技术学院 | 朱立 本文来自:大数据技术原理与应用——概念、存储、处理、分析与应用 作 者:林子雨 出版社:人民邮电出版社 版权说明 若作者对本资料使用持有异议,请及时联系本网站,我们将在第一时间妥善处理。 2 1 从Shark说起 Shark即Hive on Spark,为了实现与Hive兼容,Shark在HiveQL方面重用了Hive中HiveQL的解析、逻辑执行计划翻译、执行计划优化等逻辑,可以近似认为仅将物理执行计划从MapReduce作业替换成了Spark作业,通过Hive的HiveQL解析,把HiveQL翻译成Spark上的RDD操作。 1 从Shark说起 Hive中SQL查询的MapReduce作业转化过程 1 从Shark说起 Shark的设计导致了两个问题: 一是执行计划优化完全依赖于Hive,不方便添加新的优化策略; 二是因为Spark是线程级并行,而MapReduce是进程级并行,因此,Spark在兼容Hive的实现上存在线程安全问题,导致Shark不得不使用另外一套独立维护的打了补丁的Hive源码分支 2 Spark SQL设计 Spark SQL在Hive兼容层面仅依赖HiveQL解析、Hive元数据,也就是说,从HQL被解析成抽象语法树(AST)起,就全部由Spark SQL接管了。Spark SQL执行

文档评论(0)

1亿VIP精品文档

相关文档