揭秘hive常见面试题(四)-解释一下什么是数据倾斜,并说明在hive中如何避免数据倾斜。

举报
bigdata张凯翔 发表于 2021/03/26 01:13:18 2021/03/26
【摘要】 解释一下什么是数据倾斜,并说明在hive中如何避免数据倾斜。 参数调节: hive.map.aggr=true hive.groupby.skewindata=true 有数据倾斜的时候进行负载均衡,当选项设定为true,生成的查询计划会有两个MR Job。第一个MR Job中,Map的输出结果集合会随机分布到Reduce中,每个Reduce做部分聚合操作,并输出结果,这样处理...

解释一下什么是数据倾斜,并说明在hive中如何避免数据倾斜。

参数调节:
hive.map.aggr=true
hive.groupby.skewindata=true
有数据倾斜的时候进行负载均衡,当选项设定为true,生成的查询计划会有两个MR Job。第一个MR Job中,Map的输出结果集合会随机分布到Reduce中,每个Reduce做部分聚合操作,并输出结果,这样处理的结果是相同Group By Key有可能被分发到不同的Reduce中,从而达到负载均衡的目的;第二个MR Job在根据预处理的数据结果按照 Group By Key 分布到Reduce中(这个过程可以保证相同的 Group By Key 被分布到同一个Reduce中),最后完成最终的聚合操作。
2>SQL语句调节:
1)选用join key 分布最均匀的表作为驱动表。做好列裁剪和filter操作,以达到两表join的时候, 数据量相对变小的效果。
2)大小表Join: 使用map join让小的维度表(1000条以下的记录条数)先进内存。在Map端 完成Reduce。
3)大表Join大表:把空值的Key变成一个字符串加上一个随机数,把倾斜的数据分到不同的reduce 上,由于null值关联不上,处理后并不影响最终的结果。
4)count distinct大量相同特殊值:count distinct时,将值为空的情况单独处理,如果是计算count distinct,可以不用处理,直接过滤,在做后结果中加1。如果还有其他计算,需要进行group by, 可以先将值为空的记录单独处理,再和其他计算结果进行union.

2 如何解决数据倾斜?实际上没有办法避免,这里的解决只是个别情况起效

image.png

3、什么是数据倾斜?hadoop框架的特性决定最怕数据倾斜

image.png

文章来源: www.jianshu.com,作者:百忍成金的虚竹,版权归原作者所有,如需转载,请联系作者。

原文链接:www.jianshu.com/p/4eb5c5680720

【版权声明】本文为华为云社区用户转载文章,如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。