Hive 高频面试题及详细答案(实战完整版).docxVIP

  • 1
  • 0
  • 约5.21千字
  • 约 8页
  • 2026-09-20 发布于河北
  • 举报

Hive 高频面试题及详细答案(实战完整版).docx

Hive高频面试题及详细答案(实战完整版)

一、基础概念类

1、简单说下Hive是什么,它的核心作用是什么?

Hive是基于Hadoop的数据仓库工具,底层依托HDFS存储数据、MapReduce/Tez/Spark执行计算。它可以把结构化的SQL语句,自动翻译成分布式计算任务,让不懂Java大数据开发的人员,也能通过SQL快速处理海量离线数据。

核心作用:主要用于离线海量数据清洗、统计分析、数仓建模、报表统计,不适合实时、低延迟的查询场景。

2、Hive和MySQL的核心区别?

很多人会把两者混淆,但底层架构和使用场景完全不同,核心差异如下:

存储层面:MySQL数据存在本地磁盘;Hive数据存在HDFS分布式文件系统。

计算层面:MySQL是单机计算;Hive是分布式集群计算,可支撑TB、PB级数据。

延迟场景:MySQL低延迟,支持实时查询;Hive高延迟,只适合离线批量计算。

事务支持:MySQL完整支持事务、行级锁;Hive早期无事务,新版本仅支持有限事务,多用于分区级操作,基本不用于事务业务。

索引能力:MySQL索引高效;Hive索引基本废弃,生产靠分区、分桶、优化SQL提升效率。

3、Hive的数据库、表、数据分别存在哪里?元数据包含什么?

Hive分为元数据和真实业务数据两部分:

真实数据:

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档