讲师中心 微信公众号
AI工具推荐 视频效率加速

在PostgreSQL 15中如何优化大宽表的GROUP BY查询?

老枫小哥_9614

老枫小哥_9614

发布时间:2026-10-05 07:49:27

|

957人浏览过

|

来源于php中文网

原创

大宽表GROUP BY易落盘主因是单行体积大导致哈希表内存超work_mem,且优化器难生成并行计划;须先投影裁剪字段、建覆盖索引、协同调优work_mem与并行参数。

在postgresql 15中如何优化大宽表的group by查询?

大宽表(字段多、单行体积大)的 GROUP BY 查询在 PostgreSQL 15 中极易触发磁盘落盘、内存爆炸或并行失效——核心矛盾不是“分组逻辑复杂”,而是中间结果集占用内存远超 work_mem 预算,且优化器难以生成高效并行计划。

为什么大宽表 GROUP BY 特别容易落盘?

宽表单行可能达几 KB(比如含多个 TEXT、JSONB、长 VARCHAR 字段),而 GROUP BY 需在内存中维护每组的聚合状态 + 所有非分组列的原始值(除非用 MIN()/MAX() 等可推导函数)。PostgreSQL 不会自动裁剪未参与聚合的宽字段,导致内存用量飙升。

  • 查实锤:运行 EXPLAIN (ANALYZE, BUFFERS),重点看 HashAggregate 节点的 Disk Usage —— 只要 > 0,就是被迫写临时文件
  • 更隐蔽的问题:即使没落盘,Memory Usage 接近 work_mem 上限时,worker 进程会因内存竞争被系统拒绝启动,表现为 Workers Launched: 0
  • 别信 EXPLAIN 的预估:它不计算实际行宽,只按统计信息估算行数,对宽表严重失真

必须先做投影裁剪:SELECT 列只留 GROUP BY 键和必要聚合

这是最立竿见影的一步。大宽表下,SELECT * 或 SELECT a,b,c,... 全字段会把所有列都拖进哈希表,哪怕你只按 user_id 分组。

  • 错误写法:SELECT *, COUNT(*) FROM wide_table GROUP BY user_id —— 把整行都塞进内存
  • 正确做法:显式列出分组键和聚合字段,例如 SELECT user_id, COUNT(*), MAX(updated_at), MIN(status)
  • 如果业务真需要某宽字段的“任意值”,用 MIN(col) 或 MAX(col)(对 TEXT/JSONB 也有效),避免 ANY_VALUE()(PG 不支持)
  • 若必须返回完整行,改用窗口函数:SELECT * FROM (SELECT *, ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY updated_at DESC) rn FROM wide_table) t WHERE rn = 1,绕开 GROUP BY 内存瓶颈

work_mem 和并行参数必须协同调优

单独调高 work_mem 治标不治本;不配并行参数,work_mem 再大也只用单核。两者必须按比例设:

  • 先确认资源上限:max_worker_processes ≥ CPU 核心数 × 2(如 16 核 → 设 32),否则后续参数无效
  • 再设并行基线:max_parallel_workers = CPU 核心数(如 16 核 → 设 16),max_parallel_workers_per_gather = 4~6(勿 ≥ 8)
  • 最后定 work_mem:从 '32MB' 起步,结合查询实际宽度测试。公式参考:work_mem ≈ 行宽 × 分组后行数 × 1.5。例如平均行宽 2KB、分组后 10 万行 → 至少需 300MB,但此时单个查询已吃掉 4 worker × 300MB = 1.2GB,务必评估并发压力
  • 生效命令:SELECT pg_reload_conf(),无需重启

索引和分区能绕过 GROUP BY 吗?

不能直接绕过,但能大幅减少输入数据量,让 GROUP BY 处理更小的结果集——这才是宽表优化的真正杠杆点。

  • 复合索引必须覆盖 WHERE + GROUP BY:例如查询 WHERE dept = 'sales' AND status = 'active' GROUP BY user_id,建索引 CREATE INDEX idx_wide_dept_status_user ON wide_table (dept, status, user_id)
  • 分区表按高频过滤字段切分:如按 created_date 分区,查询最近 7 天数据时,优化器自动 prune 掉 99% 分区,GROUP BY 只扫真实数据子集
  • 警惕部分索引陷阱:WHERE 条件选择性低(如 status IN ('active','pending') 占全表 80%)时,索引反而不如顺序扫描,先用 EXPLAIN 验证

宽表 GROUP BY 的本质是内存带宽问题,不是算法问题。最容易被忽略的是:你看到的“慢”,往往发生在 HashAggregate 节点启动前——因为优化器发现内存不够,干脆放弃并行,退化成单线程外排。所以别只盯着执行计划末尾,先看 Workers Launched 和 Disk Usage 这两个硬指标。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
postgresql常用命令
postgresql常用命令

postgresql常用命令psql、createdb、dropdb、createuser、dropuser、l、c、dt、d table_name、du、i file_name、e和q等。本专题为大家提供postgresql相关的文章、下载、课程内容,供大家免费下载体验。

213

2023.10.10

常用的数据库软件
常用的数据库软件

常用的数据库软件有MySQL、Oracle、SQL Server、PostgreSQL、MongoDB、Redis、Cassandra、Hadoop、Spark和Amazon DynamoDB。更多关于数据库软件的内容详情请看本专题下面的文章。php中文网欢迎大家前来学习。

4289

2023.11.02

postgresql常用命令有哪些
postgresql常用命令有哪些

postgresql常用命令psql、createdb、dropdb、createuser、dropuser、l、c、dt、d table_name、du、i file_name、e和q等。更详细的postgresql常用命令,大家可以访问下面的文章。

627

2023.11.16

postgresql常用命令介绍
postgresql常用命令介绍

postgresql常用命令有l、d、d5、di、ds、dv、df、dn、db、dg、dp、c、pset、show search_path、ALTER TABLE、INSERT INTO、UPDATE、DELETE FROM、SELECT等。想了解更多postgresql的相关内容,可以阅读本专题下面的文章。

1376

2023.11.20

PostgreSQL性能优化与索引调优实战
PostgreSQL性能优化与索引调优实战

本专题面向后端开发与数据库工程师,深入讲解 PostgreSQL 查询优化原理与索引机制。内容包括执行计划分析、常见索引类型对比、慢查询优化策略、事务隔离级别以及高并发场景下的性能调优技巧。通过实战案例解析,帮助开发者提升数据库响应速度与系统稳定性。

460

2026.02.12

PostgreSQL 性能优化与查询执行计划实战
PostgreSQL 性能优化与查询执行计划实战

本专题深入解析PostgreSQL性能优化核心,聚焦查询执行计划的实战应用。通过EXPLAIN命令精准定位瓶颈,结合索引策略、SQL改写与参数调优,系统提升查询效率。从执行计划解读到性能调优全流程,助你掌握数据库性能诊断与优化实战能力。

150

2026.05.08

PostgreSQL 在 Next.js / Go 全栈架构中的工程化实践
PostgreSQL 在 Next.js / Go 全栈架构中的工程化实践

本文详解如何利用Next.js(搭配Drizzle ORM)与Go后端构建高性能应用,充分发挥PG在JSONB非结构化存储与pgvector向量检索上的优势。从数据建模到Docker容器化部署,打造支持AI时代的“One Database”工程化解决方案。

881

2026.05.08

PostgreSQL高级特性、内核机制与现代数据架构
PostgreSQL高级特性、内核机制与现代数据架构

本专题从MVCC并发控制与WAL日志等内核机制出发,详解JSONB、PostGIS及pgvector等高级特性。探讨如何利用单一引擎支撑关系型、向量及图数据等现代数据架构需求,助您掌握构建高并发、智能化应用的核心技术。

224

2026.05.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn