讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Spark SQL中避免大表GROUP BY引起的数据倾斜?

胖瑶姑娘_8602

胖瑶姑娘_8602

发布时间:2026-09-07 07:28:00

|

490人浏览过

|

来源于php中文网

原创

大表 GROUP BY 易倾斜主因是分组字段存在高频值(如"0"、空值),导致 shuffle 时大量数据集中到同一 task;需通过加盐、两阶段聚合或过滤热点 key 主动分散负载,而非仅调高并行度。

如何在spark sql中避免大表group by引起的数据倾斜?

为什么大表 GROUP BY 容易倾斜

GROUP BY 本身不倾斜,但当某个分组字段(比如 user_id)存在极少数高频值(如默认值 "0"、空字符串、测试账号),而这些值对应的数据量远超其他 key(例如百万级 vs 十几条),shuffle 阶段就会把所有相同 key 的数据拉到同一个 task 处理——这就是倾斜的根源。Spark SQL 不会自动识别“热门 key”,它只按 hash 值分发,所以 GROUP BY user_id 在遇到 user_id = "0" 占 40% 数据时,必然卡在单个 task 上。

用两阶段聚合(局部 + 全局)绕过单点瓶颈

核心思路是:先在 map 端做一次轻量聚合,打散热点;再 shuffle 后做最终合并。Spark SQL 本身不直接支持“加盐”,但可通过子查询模拟:

  • 第一阶段:对原表加随机前缀(比如 concat(user_id, '_', cast(rand() * 10 as int))),然后 GROUP BY 这个新字段,得到中间结果
  • 第二阶段:去掉前缀,按原始 user_id 再次 GROUP BY 并聚合中间结果的统计值(如 sum(cnt)

注意:rand() 要控制盐值范围(如 * 10 生成 0–9),避免分区爆炸;盐值太大反而增加 shuffle 数据量。

提前过滤或重映射明确的倾斜 key

如果已知几个导致倾斜的 key(比如 user_id IN ("0", "", "test")),不要等它们进主流程。直接拆开处理:

  • WHERE user_id NOT IN ("0", "", "test") 跑主逻辑
  • 单独对这几个 key 做聚合(甚至可转成广播变量查维表),最后用 UNION ALL 合并结果
  • 比“加盐”更干净,但前提是能枚举出倾斜 key,且业务允许忽略或特殊处理它们

若倾斜 key 是 null,别用 WHERE user_id IS NOT NULL 简单过滤——先确认 null 是否业务有效值;否则应统一替换为一个带业务含义的占位符(如 "unknown"),再参与分组。

调整 shuffle 并行度只是辅助手段

spark.sql.shuffle.partitions 默认 200,对倾斜无实质缓解。它只是把“一个超重 task”变成“多个较重 task”,但热点 key 仍全落在某几个 partition 里。只有配合加盐或过滤才有意义:

  • 加盐后,需同步调高该参数(如设为 400–800),确保盐值足够分散
  • 单纯调高参数反而可能让小 key 的 task 更多,增加调度开销
  • 线上建议先观察 stage 中各 task 输入数据量(Spark UI 的 “Input Size / Records” 列),再决定是否调整

真正关键的不是并行度数字,而是让倾斜 key 的数据流主动“变细”或“绕开” shuffle —— 过滤、加盐、两阶段聚合,三者选其一,比盲目调参管用得多。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

4036

2023.06.21

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

1209

2025.12.08

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

203

2026.01.05

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

426

2026.01.05

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

3723

2023.10.12

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

791

2023.10.27

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

949

2024.02.23

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

5501

2024.03.06

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn