hive分享_Hadoop学习资料.pptVIP

  1. 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
  2. 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  3. 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  4. 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  5. 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  6. 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  7. 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
hive分享_Hadoop学习资料

GroupBy数据倾斜 skewindata优化 用法 set hive.groupby.skewindata=true 更好的执行计划 GroupBy数据倾斜 这样做可以多一次mapreduce 减轻压力 执行优化 内存优化 驱动表 使用大表做驱动表,避免内存溢出 Join中最右边的表是驱动表 MapJoin无视Join顺序,使用大表做驱动表 STREAMTABLE I/O优化 Map aggregation 相关参数 hive.map.aggr hive.groupby.mapaggr.checkinterval (100000) hive.map.aggr.hash.percentmemory(0.5) hive.map.aggr.hash.min.reduction(0.5) 注意控制内存 执行优化 I/O优化 合并小文件 减少后续任务的map数 代价:额外的MR过程 参数: hive.merge.mapfiles hive.merge.mapredfiles hive.merge.size.per.task hive.merge.size.smallfiles.avgsize 执行优化 hive开发规范(补充) SQL中顶部的注释: #** ??? [Subject??? :? :8080/pages/viewpage.action?pageId=128287162\] ??? [Author?????? : youliang@] ??? [Created??????? : 2010-3-11] ??? [DependsOn??? :? ducheng/public/web.sql] ??? [SmokeEnv??? : home=dw_hive/hivelets/developing, date *# 建表命名规范: 源表用s_开头 临时表用t_开头 结果表用r_开头 跨sql的临时表用m_开头 如:r_youliang_usertag_base 上面这个表明就是一个结果表,花名是youliang 模块名是usertag 然后表的含义是base表示基础表 Hive分享 松坡 看着这么上面强大的功能,那Hive到底是什么呢? 其实HIVE就是一个SQL解析引擎,它将SQL语句转译成M/R JOB然后在Hadoop执行,来达到快速开发的目的。拨开HIVE的神秘面纱之后来看它的表其实就是一个Hadoop的目录/文件(HIVE默认表存放路径一般都是在你工作目录的hive目录里面),按表名做文件夹分开,如果你有分区表的话,分区值是子文件夹,可以直接在其它的M/R job里直接应用这部分数据。 Hive到底是什么? 为超大数据集设计的计算/扩展能力 based on Hadoop 支持SQL like查询语言 统一的元数据管理 简单 select word, count(*) from ( select explode(split(sentence. )) word from article ) t group by word Client端应用程序 元数据 编程接口 Database Table Partition File 数据模型 Primitive int / bigint / smallint / tinyint boolean double / float string Array Map Struct 没有精度/长度设定 int 4 没有 没有date / datetime 类型 数据类型 CREATE [EXTERNAL] TABLE [IF NOT EXISTS] table_name (col_name data_type, ...) [PARTITIONED BY (col_name data_type, ...)] [ [ROW FORMAT row_format] [STORED AS file_format] ] [LOCATION hdfs_path] DDL CREATE TABLE tmp_table #表名 ( title string, # 字段名称 字段类型 minimum_bid double, quantity bigint, have_invoice bigint )COMMENT 注释:XXX #表注释 PARTITIONED BY(pt STRING) #分区表字段(如果你文件非常之大的话,采用分区表可以快过滤出按分区字段划分的数据) ROW FORMAT DELIMITED FIELDS TERMINATED BY \001 # 字段是用什么分割开的 STORED AS S

文档评论(0)

xcs88858 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

版权声明书
用户编号:8130065136000003

1亿VIP精品文档

相关文档