- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
hive分享_Hadoop学习资料
GroupBy数据倾斜 skewindata优化 用法 set hive.groupby.skewindata=true 更好的执行计划 GroupBy数据倾斜
这样做可以多一次mapreduce 减轻压力 执行优化 内存优化 驱动表 使用大表做驱动表,避免内存溢出 Join中最右边的表是驱动表 MapJoin无视Join顺序,使用大表做驱动表 STREAMTABLE I/O优化 Map aggregation 相关参数 hive.map.aggr hive.groupby.mapaggr.checkinterval (100000) hive.map.aggr.hash.percentmemory(0.5) hive.map.aggr.hash.min.reduction(0.5) 注意控制内存 执行优化 I/O优化 合并小文件 减少后续任务的map数 代价:额外的MR过程 参数: hive.merge.mapfiles hive.merge.mapredfiles hive.merge.size.per.task hive.merge.size.smallfiles.avgsize 执行优化 hive开发规范(补充) SQL中顶部的注释: #**??? [Subject??? :? :8080/pages/viewpage.action?pageId=128287162\]??? [Author?????? : youliang@]??? [Created??????? : 2010-3-11]??? [DependsOn??? :? ducheng/public/web.sql]??? [SmokeEnv??? : home=dw_hive/hivelets/developing, date*# 建表命名规范: 源表用s_开头 临时表用t_开头 结果表用r_开头 跨sql的临时表用m_开头 如:r_youliang_usertag_base 上面这个表明就是一个结果表,花名是youliang 模块名是usertag 然后表的含义是base表示基础表 Hive分享 松坡 看着这么上面强大的功能,那Hive到底是什么呢? 其实HIVE就是一个SQL解析引擎,它将SQL语句转译成M/R JOB然后在Hadoop执行,来达到快速开发的目的。拨开HIVE的神秘面纱之后来看它的表其实就是一个Hadoop的目录/文件(HIVE默认表存放路径一般都是在你工作目录的hive目录里面),按表名做文件夹分开,如果你有分区表的话,分区值是子文件夹,可以直接在其它的M/R job里直接应用这部分数据。 Hive到底是什么? 为超大数据集设计的计算/扩展能力 based on Hadoop 支持SQL like查询语言 统一的元数据管理 简单 select word, count(*) from ( select explode(split(sentence. )) word from article ) t group by word Client端应用程序 元数据 编程接口 Database Table Partition File 数据模型 Primitive int / bigint / smallint / tinyint boolean double / float string Array Map Struct 没有精度/长度设定 int 4 没有 没有date / datetime 类型 数据类型 CREATE [EXTERNAL] TABLE [IF NOT EXISTS] table_name (col_name data_type, ...) [PARTITIONED BY (col_name data_type, ...)] [ [ROW FORMAT row_format] [STORED AS file_format] ] [LOCATION hdfs_path] DDL CREATE TABLE tmp_table #表名 ( title string, # 字段名称 字段类型 minimum_bid double, quantity bigint, have_invoice bigint )COMMENT 注释:XXX #表注释 PARTITIONED BY(pt STRING) #分区表字段(如果你文件非常之大的话,采用分区表可以快过滤出按分区字段划分的数据) ROW FORMAT DELIMITED FIELDS TERMINATED BY \001 # 字段是用什么分割开的 STORED AS S
您可能关注的文档
- C程序设计(第四版)第10章 C语言综合应用程序设计.ppt
- C语言练习题9.ppt
- 项目4-任务5 java基本项目.ppt
- 基本结构和运行过程.ppt
- 条件编译和位运算.ppt
- 第四章 简单程序.ppt
- 第03章_简单程序.ppt
- ISO9001:2000体系文件编写教材.ppt
- C语言程序设计基础(第三版)第9章_预处理.ppt
- 程序设计基础(输入输出).ppt
- 2014春八年级英语第七单元导学案.doc
- VB6.0使用DIRECTX8_3d编程资料.doc
- 八年级下册unit_6知识点.doc
- 八年级上册Unit 8 随堂练习.doc
- 2014译林版英语四年级上册4A Unit7~8单元测试.doc
- 【人教版】八年级上册英语:Unit 3 I’m more outgoing than my sister试题及答案.doc
- 2013-2014学年八年级英语上册 Module 4 Planes, Ships and trains综合测评(含解析)(新版)外研版.doc
- 树德实验西区八年级(上)2015---2016学年度12月考.doc
- 3-15卓跃教育_模板.ppt
- 八年级期中考试试卷--听力完成.doc
最近下载
- QB∕T 5775-2022 离子交换树脂再生剂 氯化钠.pdf
- 24秋初中地理七年级上册(配湘教版)第二节 气温和降水 第1课时.pptx VIP
- 生命体征测量ppt(共69张PPT).ppt VIP
- 八年级地理第二章中国的自然环境第二节-气候第一课时..ppt
- 欧姆龙PLC-CP1E的中文手册.pdf VIP
- (正式版)D-L∕T 1870-2018 电力系统网源协调技术规范.docx VIP
- 八年级地理第二章中国的自然环境第二节_气候第一课时.ppt VIP
- 八年级语文上册第—次月考卷 1、3单元(江西专用)(原卷+解释)2025-2026学年 统编版.docx VIP
- 人教版八年级地理_第二章中国的自然环境第二节气候.ppt VIP
- 八年级上册地理第二章第二节中国的气候.pptx VIP
文档评论(0)