MySQL 8.0 窗口函数 ROW_NUMBER() 去重:保留最新订单,先查再删
订单导入脚本重跑了一次,order_no 相同的记录多出了几行。这个时候直接按时间删风险很高:同一时间戳可能存了多条记录,只有主键才是完全不会重复的最终删除边界。MySQL 8.0 提供的 ROW_NUMBER() 可以先按业务唯一键分组,再按写入时间和主键排序,哪行留哪行删,结果算得明明白白。
先用窗口函数生成重复组的序号,再把序号大于 1 的主键放进临时表;确认数量、样本和备份都正确后,才执行 DELETE。
- 去重分组键要选业务定义的唯一标识,例如
shop_id + order_no,不能只靠自增主键判断重复。 ROW_NUMBER() OVER (PARTITION BY ... ORDER BY ...)中必须加一个稳定的第二排序键,时间相同时用主键做最终排序收口。- 先把待删主键写入临时表,再用关联删除的方式操作,数量核对和回滚准备的流程会非常清晰。
- 清理完成后要复查唯一性、保留行内容和实际受影响行数,避免把合法的历史版本一起误删掉。
先确定重复记录的业务边界
示例表 shop_orders 中,shop_id 和 order_no 组合代表一笔店铺维度的订单,id 是自增主键,created_at 是数据写入数据库的时间。我们的清理目标很明确:同一店铺、同一订单号只保留最晚写入的那一行。
CREATE TABLE shop_orders (
id BIGINT PRIMARY KEY AUTO_INCREMENT,
shop_id BIGINT NOT NULL,
order_no VARCHAR(40) NOT NULL,
amount DECIMAL(10, 2) NOT NULL,
order_status VARCHAR(20) NOT NULL,
created_at DATETIME(6) NOT NULL,
KEY idx_shop_order_time (shop_id, order_no, created_at)
);
SELECT shop_id, order_no, COUNT(*) AS duplicate_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;
这一步只做问题范围确认。如果业务本身允许同一个订单号在不同店铺重复,shop_id 就不能省略;如果表里存的是订单状态快照而非重复写入的脏数据,清理规则也要调整成保留每个状态的最后一条记录。
用 ROW_NUMBER() 给每个重复组排号
窗口函数不会改动原表数据,只会在查询结果里额外生成一列序号。下面的 PARTITION BY 用来定义重复分组,ORDER BY created_at DESC, id DESC 用来指定最新写入的记录排最前面;当两条记录写入时间完全相同时,数值更大的主键排在前面。
WITH ranked_orders AS (
SELECT
id,
shop_id,
order_no,
amount,
order_status,
created_at,
ROW_NUMBER() OVER (
PARTITION BY shop_id, order_no
ORDER BY created_at DESC, id DESC
) AS row_num
FROM shop_orders
)
SELECT *
FROM ranked_orders
WHERE row_num > 1
ORDER BY shop_id, order_no, row_num;
结果里序号等于 1 的 row_num = 1 就是需要保留的行,其余序号大于1的行都是待删候选。这步先别着急执行删除操作,至少抽查几个样本的订单金额、状态和写入时间;如果发现同一订单的最新行反而是失败状态,说明“按最新写入保留”的规则不符合业务需求,要把状态优先级加到排序逻辑里。

先保存待删主键,再执行可核对的删除
为了避免同一段窗口查询在删除前后得到不一致的结果,先建一张临时表把候选删除的主键全部存下来。临时表仅在当前数据库连接中可见,适合单次清理任务;如果需要人工跨连接复核或者做回滚留痕,应该用带清理批次号的永久备份表。
CREATE TEMPORARY TABLE dedup_delete_ids (
id BIGINT PRIMARY KEY
);
INSERT INTO dedup_delete_ids (id)
WITH ranked_orders AS (
SELECT
id,
ROW_NUMBER() OVER (
PARTITION BY shop_id, order_no
ORDER BY created_at DESC, id DESC
) AS row_num
FROM shop_orders
)
SELECT id
FROM ranked_orders
WHERE row_num > 1;
SELECT COUNT(*) AS delete_count
FROM dedup_delete_ids;
SELECT o.*
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id
ORDER BY o.shop_id, o.order_no, o.created_at;
核对完总数量和抽样样本都没问题之后,再在事务里按主键条件删除。删除后先检查实际影响行数,再决定提交还是回滚;不要把临时表里的ID重新关联业务字段匹配删除,不然很容易误删刚写入的新记录。
START TRANSACTION;
DELETE o
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id;
SELECT ROW_COUNT() AS affected_rows;
-- 核对 affected_rows 与 delete_count 一致后再提交
COMMIT;
-- 发现数量或样本不对时使用:ROLLBACK;

三个检查点决定能不能提交
| 检查点 | 应该看到什么 | 异常时怎么处理 |
|---|---|---|
| 候选数量 | 临时表总记录数和人工抽样统计出来的重复行数完全相等 | 回头检查分组键,确认是不是漏了租户或者店铺这类隔离字段 |
| 保留内容 | 每组序号等于1的记录对应的金额、状态、生成时间完全符合业务规则 | 回去调整排序规则,不能直接硬按主键大小删记录 |
| 删除结果 | 执行删除后的ROW_COUNT()返回值和临时表总记录数完全相等 | 立刻执行回滚,排查是不是有触发器或者并发写入的干扰 |
| 唯一性复查 | 按重复分组键查询后不会返回重复结果 | 重新校验边界数据,检查当前清理批次的逻辑有没有漏洞 |
SELECT shop_id, order_no, COUNT(*) AS remaining_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;
大表清理不要一次锁住全部重复行
几万行以内的小重复数据集,可以在业务低峰时段一次性处理完;如果是大表并且线上写入还在持续进行,建议按 id 的范围拆分批次处理,每一批次都单独记录候选行数和实际影响行数。批次之间留少量间隔,让锁等待和主从复制延迟有时间恢复。
如果删除操作需要留长期审计痕迹,先把待删记录写入归档表,至少要保存原主键、业务键、原始状态字段、清理批次号和操作人信息。临时表只适合快速临时任务,不能代替正式的长期数据归档留痕。
常见问题
ROW_NUMBER() 和 RANK() 做去重该选哪个?
删除重复行的场景基本都选 ROW_NUMBER(),它会给每一行分配完全唯一的序号;RANK() 遇到完全相同的排序值会生成并列名次,最后会导致多条重复行都被保留。
为什么 ORDER BY 排序条件里还要加主键 id?
如果只按时间排序,当时间精度不足或者批量导入时多条记录写入时间完全相同,最终生成的排序结果就会不稳定。把主键作为最后一级排序键,可以保证每次查询得到的待删候选集合完全一致。
能不能直接把 DELETE 语句套在窗口函数子查询里执行?
语法上支持写子查询,但窗口计算出来的待删结果最好先落到临时表或者备份表里,方便核对数量、保留回滚的完整证据。这种复杂删除操作落到实表后,也更容易发现并发写入带来的数据偏差。
清理完重复数据之后要不要立刻加唯一索引?
如果这些业务键本来就应该是全局唯一的,可以在确认历史数据和上游写入流程都满足约束条件之后再加;没清完残留脏数据就直接加唯一索引,很容易因为冲突直接失败,线上结构变更也要单独评估影响范围。
把“先查再删”固定成清理流程
这类数据去重的核心不是靠某条特殊SQL搞定,而是把业务去重键、保留规则、候选主键清单、实际影响行数和唯一性复查串成一条完整的证据链。后续再遇到导入重跑、接口重试造成的重复数据,先把查询结果拉出来人工审阅一遍,再开事务执行删除,风险会比直接按时间条件盲清理小很多。
Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
- 上一篇
- Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
- 下一篇
- Go sync.Map 适合热点读缓存吗:读写比例、类型断言与基准测试
-
- 数据库 · MySQL | 1小时前 | MySQL · 索引优化 · 数据库运维 · Invisible Index MySQL不可见索引 索引下线
- MySQL 不可见索引灰度验证:先观察优化器,再安全下线旧索引
- 401浏览 收藏
-
- 数据库 · MySQL | 1小时前 |
- MySQL LOAD DATA LOCAL INFILE 为什么要谨慎开启:从文件边界到双端校验
- 312浏览 收藏
-
- 数据库 · MySQL | 4小时前 | MySQL · 字符集 · 索引设计 · 前缀索引 MySQL utf8mb4 索引长度
- MySQL utf8mb4 索引为什么超长:前缀索引、排序规则与唯一性取舍
- 499浏览 收藏
-
- 数据库 · MySQL | 5小时前 | MySQL · 事务 · 数据库运维 · mysql ddl 事务回滚 TRUNCATE TABLE
- MySQL 事务里 TRUNCATE TABLE 为什么回滚不了:一次误清空临时表的事故复盘
- 382浏览 收藏
-
- 数据库 · MySQL | 7小时前 | MySQL · UPDATE JOIN · 数据修复 · SQL排查 · mysql 批量更新 UPDATE JOIN 多表更新 关联唯一性
- MySQL UPDATE JOIN 为什么会改多行:先用 SELECT 验证关联唯一性再更新
- 262浏览 收藏
-
- 数据库 · MySQL | 4天前 | MySQL · 权限管理 · 备份 · mysqldump · 数据库安全 · 最小权限 mysqldump备份账号 MySQL角色 partial_revokes 备份权限
- mysqldump 备份账号如何避免全库越权:MySQL 角色与 partial_revokes 实战
- 413浏览 收藏
-
- 数据库 · MySQL | 4天前 |
- MySQL JSON_EXTRACT 查询为什么慢:用生成列索引做一次可验证优化实验
- 278浏览 收藏
-
- 数据库 · MySQL | 5天前 | MySQL · JSON · 索引 · 数据库 · 查询优化 · 生成列 · json_extract 索引优化 列表筛选 生成列 MySQL JSON JSON索引
- MySQL JSON 字段怎么给列表筛选提速:生成列、索引与 NULL 边界
- 351浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- ljg-skills
- ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
- 4687次使用
-
- MELO音乐
- MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
- 4300次使用
-
- UniScribe
- UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
- 4248次使用
-
- 剧云
- 剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
- 4469次使用
-
- 万象有声
- 万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
- 4432次使用
-
- MySQL 明明加了索引,为什么查询还是很慢?先查这 6 个点
- 2026-06-27 374浏览
-
- golang MySQL实现对数据库表存储获取操作示例
- 2022-12-22 499浏览
-
- golang 基于 mysql 简单实现分布式读写锁
- 2023-01-07 384浏览
-
- 详解如何利用GORM实现MySQL事务
- 2023-01-07 184浏览
-
- Go语言实现操作MySQL的基础知识总结
- 2023-01-23 265浏览

