SQL优化：使用distribute by 防止数据倾斜

distribute by ：用来控制map输出结果的分发，即map端如何拆分数据给reduce端。会根据distribute by后边定义的列，根据reduce的个数进行数据分发，默认是采用hash算法。当 distribute by 后边跟的列是：rand()时，即保证每个分区的数据量基本一致...

光脚虾

19584人浏览 · 2020-02-11 22:11:47

光脚虾 · 2020-02-11 22:11:47 发布

场景

数据倾斜是大数据中很常见的一个现象，一般针对数据倾斜我们都会对数据进行加盐或者repartition 等等

distribute by rand()

distribute by ：用来控制map输出结果的分发，即map端如何拆分数据给reduce端。会根据distribute by 后边定义的列，根据reduce的个数进行数据分发，默认是采用hash算法。

当 distribute by 后边跟的列是：rand()时，即保证每个分区的数据量基本一致。

DEMO

使用方法：直接在sql结尾处加上 distribute by rand() 
举例：
select A ,B from  $table distribute by rand();

永洪数据分析社区

永洪科技，致力于打造全球领先的数据技术厂商，具备从数据应用方案咨询、BI、AIGC智能分析、数字孪生、数据资产、数据治理、数据实施的端到端大数据价值服务能力。

更多推荐

【2025年泰迪杯数据挖掘挑战赛】B题详细解题思路+数据预处理+代码分享

初步分析整理了B题的赛题分析与解题思路，后面还会更新详细的建模论文与解题代码，明天完成！

永洪数据分析社区

2025年泰迪杯数据挖掘竞赛B题论文首发+问题一二三四代码分享

针对问题二，将处理后的数据集，进行合并为一个完整的数据集作为训练数据集，性别（Sex）和年龄（Age）为类别变量，加速度计数据作为输入数据，MET值作为输出数据，引入随机森林回归器、随机森林、支持向量机、多层感知机、GBDT进行训练模型，并利用RMSE对模型精度进行评估。原始数据存储于CSV格式文件中，其中记录了时间戳和对应的三轴加速度值（X，Y，Z轴），这些数据反映了个体在空间中各个方向上的加