MySQL 8.0 窗口函数 ROW_NUMBER() 去重:保留最新订单,先查再删
订单导入脚本重跑了一次,order_no 相同的记录多出了几行。这个时候直接按时间删风险很高:同一时间戳可能存了多条记录,只有主键才是完全不会重复的最终删除边界。MySQL 8.0 提供的 ROW_NUMBER() 可以先按业务唯一键分组,再按写入时间和主键排序,哪行留哪行删,结果算得明明白白。
先用窗口函数生成重复组的序号,再把序号大于 1 的主键放进临时表;确认数量、样本和备份都正确后,才执行 DELETE。
- 去重分组键要选业务定义的唯一标识,例如
shop_id + order_no,不能只靠自增主键判断重复。 ROW_NUMBER() OVER (PARTITION BY ... ORDER BY ...)中必须加一个稳定的第二排序键,时间相同时用主键做最终排序收口。- 先把待删主键写入临时表,再用关联删除的方式操作,数量核对和回滚准备的流程会非常清晰。
- 清理完成后要复查唯一性、保留行内容和实际受影响行数,避免把合法的历史版本一起误删掉。
先确定重复记录的业务边界
示例表 shop_orders 中,shop_id 和 order_no 组合代表一笔店铺维度的订单,id 是自增主键,created_at 是数据写入数据库的时间。我们的清理目标很明确:同一店铺、同一订单号只保留最晚写入的那一行。
CREATE TABLE shop_orders (
id BIGINT PRIMARY KEY AUTO_INCREMENT,
shop_id BIGINT NOT NULL,
order_no VARCHAR(40) NOT NULL,
amount DECIMAL(10, 2) NOT NULL,
order_status VARCHAR(20) NOT NULL,
created_at DATETIME(6) NOT NULL,
KEY idx_shop_order_time (shop_id, order_no, created_at)
);
SELECT shop_id, order_no, COUNT(*) AS duplicate_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;
这一步只做问题范围确认。如果业务本身允许同一个订单号在不同店铺重复,shop_id 就不能省略;如果表里存的是订单状态快照而非重复写入的脏数据,清理规则也要调整成保留每个状态的最后一条记录。
用 ROW_NUMBER() 给每个重复组排号
窗口函数不会改动原表数据,只会在查询结果里额外生成一列序号。下面的 PARTITION BY 用来定义重复分组,ORDER BY created_at DESC, id DESC 用来指定最新写入的记录排最前面;当两条记录写入时间完全相同时,数值更大的主键排在前面。
WITH ranked_orders AS (
SELECT
id,
shop_id,
order_no,
amount,
order_status,
created_at,
ROW_NUMBER() OVER (
PARTITION BY shop_id, order_no
ORDER BY created_at DESC, id DESC
) AS row_num
FROM shop_orders
)
SELECT *
FROM ranked_orders
WHERE row_num > 1
ORDER BY shop_id, order_no, row_num;
结果里序号等于 1 的 row_num = 1 就是需要保留的行,其余序号大于1的行都是待删候选。这步先别着急执行删除操作,至少抽查几个样本的订单金额、状态和写入时间;如果发现同一订单的最新行反而是失败状态,说明“按最新写入保留”的规则不符合业务需求,要把状态优先级加到排序逻辑里。

先保存待删主键,再执行可核对的删除
为了避免同一段窗口查询在删除前后得到不一致的结果,先建一张临时表把候选删除的主键全部存下来。临时表仅在当前数据库连接中可见,适合单次清理任务;如果需要人工跨连接复核或者做回滚留痕,应该用带清理批次号的永久备份表。
CREATE TEMPORARY TABLE dedup_delete_ids (
id BIGINT PRIMARY KEY
);
INSERT INTO dedup_delete_ids (id)
WITH ranked_orders AS (
SELECT
id,
ROW_NUMBER() OVER (
PARTITION BY shop_id, order_no
ORDER BY created_at DESC, id DESC
) AS row_num
FROM shop_orders
)
SELECT id
FROM ranked_orders
WHERE row_num > 1;
SELECT COUNT(*) AS delete_count
FROM dedup_delete_ids;
SELECT o.*
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id
ORDER BY o.shop_id, o.order_no, o.created_at;
核对完总数量和抽样样本都没问题之后,再在事务里按主键条件删除。删除后先检查实际影响行数,再决定提交还是回滚;不要把临时表里的ID重新关联业务字段匹配删除,不然很容易误删刚写入的新记录。
START TRANSACTION;
DELETE o
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id;
SELECT ROW_COUNT() AS affected_rows;
-- 核对 affected_rows 与 delete_count 一致后再提交
COMMIT;
-- 发现数量或样本不对时使用:ROLLBACK;

三个检查点决定能不能提交
| 检查点 | 应该看到什么 | 异常时怎么处理 |
|---|---|---|
| 候选数量 | 临时表总记录数和人工抽样统计出来的重复行数完全相等 | 回头检查分组键,确认是不是漏了租户或者店铺这类隔离字段 |
| 保留内容 | 每组序号等于1的记录对应的金额、状态、生成时间完全符合业务规则 | 回去调整排序规则,不能直接硬按主键大小删记录 |
| 删除结果 | 执行删除后的ROW_COUNT()返回值和临时表总记录数完全相等 | 立刻执行回滚,排查是不是有触发器或者并发写入的干扰 |
| 唯一性复查 | 按重复分组键查询后不会返回重复结果 | 重新校验边界数据,检查当前清理批次的逻辑有没有漏洞 |
SELECT shop_id, order_no, COUNT(*) AS remaining_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;
大表清理不要一次锁住全部重复行
几万行以内的小重复数据集,可以在业务低峰时段一次性处理完;如果是大表并且线上写入还在持续进行,建议按 id 的范围拆分批次处理,每一批次都单独记录候选行数和实际影响行数。批次之间留少量间隔,让锁等待和主从复制延迟有时间恢复。
如果删除操作需要留长期审计痕迹,先把待删记录写入归档表,至少要保存原主键、业务键、原始状态字段、清理批次号和操作人信息。临时表只适合快速临时任务,不能代替正式的长期数据归档留痕。
常见问题
ROW_NUMBER() 和 RANK() 做去重该选哪个?
删除重复行的场景基本都选 ROW_NUMBER(),它会给每一行分配完全唯一的序号;RANK() 遇到完全相同的排序值会生成并列名次,最后会导致多条重复行都被保留。
为什么 ORDER BY 排序条件里还要加主键 id?
如果只按时间排序,当时间精度不足或者批量导入时多条记录写入时间完全相同,最终生成的排序结果就会不稳定。把主键作为最后一级排序键,可以保证每次查询得到的待删候选集合完全一致。
能不能直接把 DELETE 语句套在窗口函数子查询里执行?
语法上支持写子查询,但窗口计算出来的待删结果最好先落到临时表或者备份表里,方便核对数量、保留回滚的完整证据。这种复杂删除操作落到实表后,也更容易发现并发写入带来的数据偏差。
清理完重复数据之后要不要立刻加唯一索引?
如果这些业务键本来就应该是全局唯一的,可以在确认历史数据和上游写入流程都满足约束条件之后再加;没清完残留脏数据就直接加唯一索引,很容易因为冲突直接失败,线上结构变更也要单独评估影响范围。
把“先查再删”固定成清理流程
这类数据去重的核心不是靠某条特殊SQL搞定,而是把业务去重键、保留规则、候选主键清单、实际影响行数和唯一性复查串成一条完整的证据链。后续再遇到导入重跑、接口重试造成的重复数据,先把查询结果拉出来人工审阅一遍,再开事务执行删除,风险会比直接按时间条件盲清理小很多。
Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
- 上一篇
- Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
- 下一篇
- Go sync.Map 适合热点读缓存吗:读写比例、类型断言与基准测试
-
- 数据库 · MySQL | 37分钟前 | MySQL · 索引 · 性能优化 · 执行计划 · mysql explain optimizer hint FORCE INDEX USE INDEX
- MySQL optimizer hint 和 FORCE INDEX 怎么选择
- 478浏览 收藏
-
- 数据库 · MySQL | 1小时前 | MySQL · explain · 性能分析 · JSON执行计划 · 嵌套循环 · mysql 执行计划 EXPLAIN FORMAT=JSON nested_loop 查询成本
- MySQL EXPLAIN FORMAT=JSON 怎么查看嵌套循环成本
- 166浏览 收藏
-
- 数据库 · MySQL | 7小时前 |
- MySQL collation 不一致导致 JOIN 报错怎么统一
- 446浏览 收藏
-
- 数据库 · MySQL | 15小时前 |
- MySQL 递归 CTE 生成日期序列时为什么列类型会截断
- 104浏览 收藏
-
- 数据库 · MySQL | 19小时前 |
- MySQL 递归 CTE 遍历树数据时怎么防止无限循环
- 142浏览 收藏
-
- 数据库 · MySQL | 22小时前 |
- MySQL invisible index 如何安全观察索引下线影响
- 300浏览 收藏
-
- 数据库 · MySQL | 23小时前 | MySQL · 索引优化 · generated column · mysql 索引 优化器 生成列
- MySQL 生成列索引为什么没有被优化器使用
- 300浏览 收藏
-
- 数据库 · MySQL | 1天前 |
- MySQL 窗口函数取每组最新记录时如何处理并列时间
- 242浏览 收藏
-
- 数据库 · MySQL | 1天前 |
- MySQL JSON_VALUE 返回 NULL 时怎么区分缺少路径和空值
- 170浏览 收藏
-
- 数据库 · MySQL | 1天前 | MySQL · JSON查询 · JSON_TABLE · SQL技巧 · mysql JSON_TABLE FOR ORDINALITY JSON数组序号
- MySQL JSON_TABLE 的 FOR ORDINALITY 怎么保留数组原始序号
- 139浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 61次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 217次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 145次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 79次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 56次使用
-
- MySQL 明明加了索引,为什么查询还是很慢?先查这 6 个点
- 2026-06-27 374浏览
-
- golang MySQL实现对数据库表存储获取操作示例
- 2022-12-22 499浏览
-
- golang 基于 mysql 简单实现分布式读写锁
- 2023-01-07 384浏览
-
- 详解如何利用GORM实现MySQL事务
- 2023-01-07 184浏览
-
- Go语言实现操作MySQL的基础知识总结
- 2023-01-23 265浏览

