必须用子查询或JOIN获取重复值对应的所有行,因GROUP BY仅返回分组摘要;IN对NULL失效,应改用EXISTS或窗口函数ROW_NUMBER()(MySQL 8.0+)标记并筛选重复行。

用 GROUP BY + HAVING 找出重复值对应的所有行
单纯用 GROUP BY 只能拿到重复的值本身(比如重复的邮箱),但你真正要的是“所有包含这些重复值的完整记录”。这时候必须结合子查询或连接——先找出哪些值重复了,再把原表中匹配这些值的行捞出来。
常见错误是直接写 SELECT * FROM t GROUP BY col HAVING COUNT(*) > 1,这在 MySQL 5.7+ 严格模式下会报错:Expression #1 of SELECT list is not in GROUP BY clause,而且即使能执行,结果也是每组随机一行,不是“所有重复行”。
- 先用子查询得到所有重复的值:
SELECT col FROM t GROUP BY col HAVING COUNT(*) > 1 - 再用
IN或JOIN关联回原表:SELECT * FROM t WHERE col IN (SELECT col FROM t GROUP BY col HAVING COUNT(*) > 1) - 如果列可能为
NULL,IN会失效(NULL NOT IN (...)恒为UNKNOWN),改用EXISTS更稳妥
用窗口函数 ROW_NUMBER()(MySQL 8.0+)更直观地标记重复行
如果你用的是 MySQL 8.0 或更新版本,ROW_NUMBER() 能直接给每组内的行编号,比嵌套子查询更易读、也更容易扩展(比如只要第 2 次出现的那条,或排除第一次)。
注意:窗口函数不能用在 WHERE 子句里,得用派生表或 CTE 包一层。
- 示例(查出所有重复行,含首次出现):
SELECT id, col, other_col FROM ( SELECT *, ROW_NUMBER() OVER (PARTITION BY col ORDER BY id) AS rn, COUNT(*) OVER (PARTITION BY col) AS cnt FROM t ) t2 WHERE cnt > 1; -
cnt > 1表示该col值至少出现两次;rn > 1则只取重复中的后续行(跳过第一次) - 性能上,窗口函数通常比两层子查询快,尤其当
col有索引时
为什么不能只用 DISTINCT 或 GROUP BY 直接查所有重复记录
因为 DISTINCT 是去重,GROUP BY 是聚合——它们的设计目标都不是“展开所有原始行”。想绕开子查询或窗口函数,硬用 GROUP_CONCAT(id) 拼 ID 列表再 FIND_IN_SET,不仅可读性差,还受限于 group_concat_max_len 配置,且无法返回其他字段完整值。
-
SELECT col, GROUP_CONCAT(id) FROM t GROUP BY col HAVING COUNT(*) > 1只返回汇总信息,不是你要的“所有记录” - 没有索引的列上执行这类查询会全表扫描,重复值越多,子查询或窗口函数的中间结果集越大
- 若表很大,建议先确认
col上是否有索引;没有的话,GROUP BY col会非常慢
查重复时忽略大小写或空格的处理要点
业务中常遇到 “abc@ex.com” 和 “ABC@EX.COM” 被当成不同值,但实际应视为重复。这时不能直接对原始列操作,得统一转换后再分组。
- 大小写不敏感:用
LOWER(col)或确保列使用_ci校对规则(如utf8mb4_unicode_ci) - 首尾空格干扰:用
TRIM(col),但注意TRIM无法处理中间多余空格,必要时加REPLACE(col, ' ', '') - 校对规则影响
GROUP BY和=判断,比函数转换更底层、也更高效;修改前务必确认应用层是否依赖当前大小写敏感行为
有些场景下重复逻辑其实隐含业务含义(比如“同一手机号绑了多个用户”,但其中一个是测试账号),光靠 SQL 查出来还不够——得结合业务规则决定保留哪条、清理哪条。函数、索引、校对规则选哪个,取决于你用的 MySQL 版本和数据质量现状。


















