在MySQL数据库的日常使用中,表中出现重复数据是非常常见的情况,这些重复数据可能由重复插入、同步异常等原因导致,既浪费存储空间,也会影响业务查询的准确性,因此需要掌握查询和删除重复记录的相关SQL技巧。

查询重复记录的方法
查询重复记录的核心思路是先对需要判断重复的字段进行分组,筛选出分组后数量大于1的组,再关联原表获取完整的重复记录信息。
查询单字段重复记录
如果只需要判断单个字段是否重复,比如用户表中手机号重复的情况,可以使用如下SQL:
-- 查询user表中phone字段重复的记录,只返回重复的phone值 SELECT phone, COUNT(*) AS repeat_count FROM user GROUP BY phone HAVING COUNT(*) > 1;
如果需要获取重复记录的完整信息,可以关联原表查询:
-- 查询user表中phone字段重复的所有完整记录
SELECT u.*
FROM user u
JOIN (
SELECT phone
FROM user
GROUP BY phone
HAVING COUNT(*) > 1
) t ON u.phone = t.phone
ORDER BY u.phone;
查询多字段重复记录
当需要判断多个字段组合重复时,比如订单表中用户ID和商品ID都相同的记录属于重复,SQL编写如下:
-- 查询order表中user_id和goods_id组合重复的记录 SELECT user_id, goods_id, COUNT(*) AS repeat_count FROM order GROUP BY user_id, goods_id HAVING COUNT(*) > 1;
删除重复记录的方法
删除重复记录需要根据需求选择不同的方案,常见的需求是保留重复记录中的一条,删除其余重复数据。
保留最小ID的重复记录
假设表中存在自增主键id,需要删除重复记录,只保留id最小的那条,可以使用子查询的方式实现:
-- 删除user表中phone重复的记录,只保留id最小的那条
DELETE FROM user
WHERE id NOT IN (
SELECT min_id FROM (
SELECT MIN(id) AS min_id
FROM user
GROUP BY phone
) t
);
注意这里需要多套一层子查询,避免MySQL不允许在删除时直接查询同一张表的限制。
保留最大ID的重复记录
如果需要保留id最大的重复记录,只需要把MIN换成MAX即可:
-- 删除user表中phone重复的记录,只保留id最大的那条
DELETE FROM user
WHERE id NOT IN (
SELECT max_id FROM (
SELECT MAX(id) AS max_id
FROM user
GROUP BY phone
) t
);
使用临时表删除重复记录
如果表数据量较大,子查询的方式效率可能不高,也可以先创建临时表存储需要保留的记录,再清空原表插入数据:
-- 创建临时表存储每个phone对应的最小id记录
CREATE TEMPORARY TABLE temp_user AS
SELECT * FROM user
WHERE id IN (
SELECT MIN(id) FROM user GROUP BY phone
);
-- 清空原表
TRUNCATE TABLE user;
-- 把临时表数据插回原表
INSERT INTO user SELECT * FROM temp_user;
-- 删除临时表
DROP TEMPORARY TABLE temp_user;
注意事项
- 执行删除操作前一定要先备份数据,避免误删重要数据。
- 如果表没有主键,需要先确认判断重复的依据,再调整SQL逻辑。
- 删除操作建议在测试环境先验证,确认结果符合预期再在生产环境执行。
- 如果重复记录数量非常多,删除操作可能会锁表,建议选择业务低峰期执行。