最直接查重复值的方式是WHERE后接子查询,用IN匹配分组计数大于1的字段组合;需注意NULL陷阱、别名要求、索引优化及版本兼容性,老版本MySQL须回避窗口函数。

子查询放在WHERE里查重复值最直接
想快速找出表里重复的字段组合,WHERE后接子查询是最常用也最不容易出错的方式。核心思路是:对某列(或列组合)分组计数,再把计数大于1的值拎出来,用IN或=匹配原表。
- 别用
SELECT *套子查询——容易因NULL或多行返回报错,优先用IN搭配单列结果 - 子查询必须加别名(哪怕不用),否则某些数据库(如MySQL 8.0+严格模式)会报
Every derived table must have its own alias - 如果查的是多字段重复(比如
name和email同时相同),子查询里得用GROUP BY name, email,外面WHERE (name, email) IN (...)要括号包住,PostgreSQL/MySQL 8.0+支持,但SQLite不支持,得拆成AND连接
用EXISTS替代IN避免NULL陷阱
IN遇到子查询结果含NULL时整个条件变UNKNOWN,查不到任何数据——这是线上最容易踩的静默坑。换成EXISTS能绕过这个问题,逻辑更可靠。
SELECT * FROM users u1
WHERE EXISTS (
SELECT 1 FROM users u2
WHERE u2.email = u1.email
AND u2.id != u1.id
);-
EXISTS只关心子查询是否返回行,不依赖值本身,天然免疫NULL - 关联字段记得加索引,否则
EXISTS嵌套扫描性能会断崖下跌 - 别漏掉
u2.id != u1.id这类自排除条件,否则每条记录都会匹配自己,全表都“重复”
窗口函数比子查询更高效(但版本有要求)
如果数据库支持窗口函数(PostgreSQL 8.4+、SQL Server 2005+、MySQL 8.0+、Oracle),用ROW_NUMBER()或COUNT() OVER直接标记重复,比嵌套子查询快得多,尤其数据量大时。
SELECT id, name, email
FROM (
SELECT id, name, email,
COUNT(*) OVER (PARTITION BY email) AS cnt
FROM users
) t
WHERE cnt > 1;-
PARTITION BY字段要和业务重复判定逻辑一致,比如按email判重就别写成name -
COUNT() OVER比ROW_NUMBER()更适合“找所有重复项”,后者只能标序号,还得配合MAX/MIN二次聚合 - 老版本MySQL(5.7及之前)不支持窗口函数,强行用会报
ERROR 1064,得切回子查询方案
DELETE重复记录时子查询不能直接引用目标表
想删重复只留一条?很多新手写DELETE FROM users WHERE id NOT IN (子查询),结果报错You can't specify target table 'users' for update in FROM clause(MySQL)或类似语法限制。
- 必须给子查询套一层临时表包装,例如
DELETE FROM users WHERE id NOT IN (SELECT id FROM (SELECT MIN(id) id FROM users GROUP BY email) t) - PostgreSQL允许直接在
DELETE里用USING关联子查询,但MySQL不行,跨库迁移时这里容易翻车 - 操作前务必先
SELECT验证子查询结果,删错不可逆
实际用哪招,取决于你手头的数据库版本、数据量大小,还有重复判定逻辑是否涉及NULL或复合字段——这些细节没对齐,再标准的写法也会失效。

















