hive分享_Hadoop学习资料.pptVIP

下载本文档

37
0
约1.02万字
约 37页
2018-01-05 发布于河南
举报
版权申诉

hive分享_Hadoop学习资料.ppt

1、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
4、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
5、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
6、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
7、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

hive分享_Hadoop学习资料

GroupBy数据倾斜 skewindata优化用法 set hive.groupby.skewindata=true 更好的执行计划 GroupBy数据倾斜这样做可以多一次mapreduce 减轻压力执行优化内存优化驱动表使用大表做驱动表，避免内存溢出 Join中最右边的表是驱动表 MapJoin无视Join顺序，使用大表做驱动表 STREAMTABLE I/O优化 Map aggregation 相关参数 hive.map.aggr hive.groupby.mapaggr.checkinterval (100000) hive.map.aggr.hash.percentmemory(0.5) hive.map.aggr.hash.min.reduction(0.5) 注意控制内存执行优化 I/O优化合并小文件减少后续任务的map数代价：额外的MR过程参数： hive.merge.mapfiles hive.merge.mapredfiles hive.merge.size.per.task hive.merge.size.smallfiles.avgsize 执行优化 hive开发规范(补充) SQL中顶部的注释: #**??? [Subject??? :? :8080/pages/viewpage.action?pageId=128287162\]??? [Author?????? : youliang@]??? [Created??????? : 2010-3-11]??? [DependsOn??? :? ducheng/public/web.sql]??? [SmokeEnv??? : home=dw_hive/hivelets/developing, date*# 建表命名规范: 源表用s_开头临时表用t_开头结果表用r_开头跨sql的临时表用m_开头如:r_youliang_usertag_base 上面这个表明就是一个结果表,花名是youliang 模块名是usertag 然后表的含义是base表示基础表 Hive分享松坡看着这么上面强大的功能，那Hive到底是什么呢？其实HIVE就是一个SQL解析引擎，它将SQL语句转译成M/R JOB然后在Hadoop执行，来达到快速开发的目的。拨开HIVE的神秘面纱之后来看它的表其实就是一个Hadoop的目录/文件（HIVE默认表存放路径一般都是在你工作目录的hive目录里面），按表名做文件夹分开，如果你有分区表的话，分区值是子文件夹，可以直接在其它的M/R job里直接应用这部分数据。 Hive到底是什么？为超大数据集设计的计算/扩展能力 based on Hadoop 支持SQL like查询语言统一的元数据管理简单 select word, count(*) from ( select explode(split(sentence. )) word from article ) t group by word Client端应用程序元数据编程接口 Database Table Partition File 数据模型 Primitive int / bigint / smallint / tinyint boolean double / float string Array Map Struct 没有精度/长度设定 int 4 没有没有date / datetime 类型数据类型 CREATE [EXTERNAL] TABLE [IF NOT EXISTS] table_name (col_name data_type, ...) [PARTITIONED BY (col_name data_type, ...)] [ [ROW FORMAT row_format] [STORED AS file_format] ] [LOCATION hdfs_path] DDL CREATE TABLE tmp_table #表名 ( title string, # 字段名称字段类型 minimum_bid double, quantity bigint, have_invoice bigint )COMMENT 注释：XXX #表注释 PARTITIONED BY(pt STRING) #分区表字段（如果你文件非常之大的话，采用分区表可以快过滤出按分区字段划分的数据） ROW FORMAT DELIMITED FIELDS TERMINATED BY \001 # 字段是用什么分割开的 STORED AS S