用窗口函数ROW_NUMBER()配合子查询过滤是获取每组首行记录的正确方法,需注意NULL分组键归为一组、索引优化及并列情况处理。

用 ROW_NUMBER() 拿到每组第一条原始记录
分组后想保留原始行(比如每个用户最新一笔订单、每个品类最贵商品),不能只靠 GROUP BY —— 它会丢字段、聚合值,没法返回整行。窗口函数才是解法,核心是先编号再过滤。
常见错误是写成 SELECT *, ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY create_time DESC) FROM orders 却忘了加 WHERE 筛选,结果还是全量数据。
-
ORDER BY必须明确:时间字段要DESC才能取“最新”,数值字段要DESC才能取“最高” - 如果存在并列(比如同一用户两笔订单时间完全相同),
ROW_NUMBER()会强制排序,RANK()或DENSE_RANK()可能更合适,但会返回多行 - MySQL 8.0+、PostgreSQL、SQL Server 2005+、Oracle 都支持;SQLite 3.25+ 也行,旧版不支持窗口函数
示例:
SELECT * FROM (
SELECT *,
ROW_NUMBER() OVER (PARTITION BY category ORDER BY price DESC) AS rn
FROM products
) t WHERE rn = 1;
遇到 NULL 分组键时 PARTITION BY 的行为
PARTITION BY 字段为 NULL 时,所有 NULL 值会被归为同一组——这常被忽略,导致“意外聚合”。比如按 region 分组取最新订单,但部分记录 region IS NULL,它们全挤进一组,ROW_NUMBER() 就在这一堆 NULL 里排号。
- 检查前先跑
SELECT COUNT(*) FROM table WHERE partition_col IS NULL,心里有数 - 想把
NULL当独立组处理?不行,SQL 标准里NULL = NULL不成立,窗口函数也不会拆开 - 稳妥做法是提前用
CASE WHEN或COALESCE()替换NULL,例如PARTITION BY COALESCE(region, 'UNKNOWN')
性能敏感场景下避免全表扫描
窗口函数本身不索引友好,尤其 PARTITION BY + ORDER BY 组合大表时容易慢。不是语法写错,而是执行计划可能走不了索引。
- 确保
PARTITION BY和ORDER BY字段上有联合索引,顺序要一致:比如(category, price DESC) - 如果只查某几个分组(如
WHERE category IN ('A','B')),把条件写在子查询外层,别放内层——否则优化器可能无法下推 - PostgreSQL 中可用
SELECT ... FROM LATERAL (SELECT ... LIMIT 1) AS t替代窗口函数,在某些场景更快,但逻辑等价性需验证
想取每组多条记录(比如 Top 3)怎么改
把 rn = 1 改成 rn 最直接,但要注意:这是“每组最多三条”,不是“全局 Top 3”。如果某组只有两条,结果就是两条;另一组有十一条,也只取前三条。
- 别用
LIMIT 3替代——它作用于整个结果集,不是分组内 - 如果需要“并列也算”,比如价格并列第三的都留下,换用
RANK():当第 2、3 行价格相同时,它们都是RANK = 2,RANK 就能包含它们 -
DENSE_RANK()适合连续排名需求(无空缺),但对“取前 N”没本质区别,选哪个取决于业务定义
实际用的时候,最容易卡在 PARTITION BY 字段含 NULL 和索引没对上这两点。窗口函数语法看着简单,执行效率和边界行为得动手试一试才放心。

















