当前位置:首页 > 文章列表 > 数据库 > MySQL > MySQL 8.0 窗口函数 ROW_NUMBER() 去重:保留最新订单,先查再删

MySQL 8.0 窗口函数 ROW_NUMBER() 去重:保留最新订单,先查再删

来源:17golang原创 2026-07-26 14:21:47 0浏览 收藏

订单导入脚本重跑了一次,order_no 相同的记录多出了几行。这个时候直接按时间删风险很高:同一时间戳可能存了多条记录,只有主键才是完全不会重复的最终删除边界。MySQL 8.0 提供的 ROW_NUMBER() 可以先按业务唯一键分组,再按写入时间和主键排序,哪行留哪行删,结果算得明明白白。

先用窗口函数生成重复组的序号,再把序号大于 1 的主键放进临时表;确认数量、样本和备份都正确后,才执行 DELETE。

要点速览
  • 去重分组键要选业务定义的唯一标识,例如 shop_id + order_no,不能只靠自增主键判断重复。
  • ROW_NUMBER() OVER (PARTITION BY ... ORDER BY ...) 中必须加一个稳定的第二排序键,时间相同时用主键做最终排序收口。
  • 先把待删主键写入临时表,再用关联删除的方式操作,数量核对和回滚准备的流程会非常清晰。
  • 清理完成后要复查唯一性、保留行内容和实际受影响行数,避免把合法的历史版本一起误删掉。

先确定重复记录的业务边界

示例表 shop_orders 中,shop_idorder_no 组合代表一笔店铺维度的订单,id 是自增主键,created_at 是数据写入数据库的时间。我们的清理目标很明确:同一店铺、同一订单号只保留最晚写入的那一行。

CREATE TABLE shop_orders (
  id BIGINT PRIMARY KEY AUTO_INCREMENT,
  shop_id BIGINT NOT NULL,
  order_no VARCHAR(40) NOT NULL,
  amount DECIMAL(10, 2) NOT NULL,
  order_status VARCHAR(20) NOT NULL,
  created_at DATETIME(6) NOT NULL,
  KEY idx_shop_order_time (shop_id, order_no, created_at)
);

SELECT shop_id, order_no, COUNT(*) AS duplicate_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;

这一步只做问题范围确认。如果业务本身允许同一个订单号在不同店铺重复,shop_id 就不能省略;如果表里存的是订单状态快照而非重复写入的脏数据,清理规则也要调整成保留每个状态的最后一条记录。

用 ROW_NUMBER() 给每个重复组排号

窗口函数不会改动原表数据,只会在查询结果里额外生成一列序号。下面的 PARTITION BY 用来定义重复分组,ORDER BY created_at DESC, id DESC 用来指定最新写入的记录排最前面;当两条记录写入时间完全相同时,数值更大的主键排在前面。

WITH ranked_orders AS (
  SELECT
    id,
    shop_id,
    order_no,
    amount,
    order_status,
    created_at,
    ROW_NUMBER() OVER (
      PARTITION BY shop_id, order_no
      ORDER BY created_at DESC, id DESC
    ) AS row_num
  FROM shop_orders
)
SELECT *
FROM ranked_orders
WHERE row_num > 1
ORDER BY shop_id, order_no, row_num;

结果里序号等于 1 的 row_num = 1 就是需要保留的行,其余序号大于1的行都是待删候选。这步先别着急执行删除操作,至少抽查几个样本的订单金额、状态和写入时间;如果发现同一订单的最新行反而是失败状态,说明“按最新写入保留”的规则不符合业务需求,要把状态优先级加到排序逻辑里。

MySQL ROW_NUMBER 按 shop_id 和 order_no 分组后,以 created_at 与 id 排序区分保留行和重复行

先保存待删主键,再执行可核对的删除

为了避免同一段窗口查询在删除前后得到不一致的结果,先建一张临时表把候选删除的主键全部存下来。临时表仅在当前数据库连接中可见,适合单次清理任务;如果需要人工跨连接复核或者做回滚留痕,应该用带清理批次号的永久备份表。

CREATE TEMPORARY TABLE dedup_delete_ids (
  id BIGINT PRIMARY KEY
);

INSERT INTO dedup_delete_ids (id)
WITH ranked_orders AS (
  SELECT
    id,
    ROW_NUMBER() OVER (
      PARTITION BY shop_id, order_no
      ORDER BY created_at DESC, id DESC
    ) AS row_num
  FROM shop_orders
)
SELECT id
FROM ranked_orders
WHERE row_num > 1;

SELECT COUNT(*) AS delete_count
FROM dedup_delete_ids;

SELECT o.*
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id
ORDER BY o.shop_id, o.order_no, o.created_at;

核对完总数量和抽样样本都没问题之后,再在事务里按主键条件删除。删除后先检查实际影响行数,再决定提交还是回滚;不要把临时表里的ID重新关联业务字段匹配删除,不然很容易误删刚写入的新记录。

START TRANSACTION;

DELETE o
FROM shop_orders AS o
JOIN dedup_delete_ids AS d ON d.id = o.id;

SELECT ROW_COUNT() AS affected_rows;

-- 核对 affected_rows 与 delete_count 一致后再提交
COMMIT;
-- 发现数量或样本不对时使用:ROLLBACK;

MySQL 先把 ROW_NUMBER 重复行的主键放入临时表,再按主键删除并核对影响行数的清理流程

三个检查点决定能不能提交

检查点应该看到什么异常时怎么处理
候选数量临时表总记录数和人工抽样统计出来的重复行数完全相等回头检查分组键,确认是不是漏了租户或者店铺这类隔离字段
保留内容每组序号等于1的记录对应的金额、状态、生成时间完全符合业务规则回去调整排序规则,不能直接硬按主键大小删记录
删除结果执行删除后的ROW_COUNT()返回值和临时表总记录数完全相等立刻执行回滚,排查是不是有触发器或者并发写入的干扰
唯一性复查按重复分组键查询后不会返回重复结果重新校验边界数据,检查当前清理批次的逻辑有没有漏洞
SELECT shop_id, order_no, COUNT(*) AS remaining_count
FROM shop_orders
GROUP BY shop_id, order_no
HAVING COUNT(*) > 1;

大表清理不要一次锁住全部重复行

几万行以内的小重复数据集,可以在业务低峰时段一次性处理完;如果是大表并且线上写入还在持续进行,建议按 id 的范围拆分批次处理,每一批次都单独记录候选行数和实际影响行数。批次之间留少量间隔,让锁等待和主从复制延迟有时间恢复。

如果删除操作需要留长期审计痕迹,先把待删记录写入归档表,至少要保存原主键、业务键、原始状态字段、清理批次号和操作人信息。临时表只适合快速临时任务,不能代替正式的长期数据归档留痕。

常见问题

ROW_NUMBER() 和 RANK() 做去重该选哪个?

删除重复行的场景基本都选 ROW_NUMBER(),它会给每一行分配完全唯一的序号;RANK() 遇到完全相同的排序值会生成并列名次,最后会导致多条重复行都被保留。

为什么 ORDER BY 排序条件里还要加主键 id?

如果只按时间排序,当时间精度不足或者批量导入时多条记录写入时间完全相同,最终生成的排序结果就会不稳定。把主键作为最后一级排序键,可以保证每次查询得到的待删候选集合完全一致。

能不能直接把 DELETE 语句套在窗口函数子查询里执行?

语法上支持写子查询,但窗口计算出来的待删结果最好先落到临时表或者备份表里,方便核对数量、保留回滚的完整证据。这种复杂删除操作落到实表后,也更容易发现并发写入带来的数据偏差。

清理完重复数据之后要不要立刻加唯一索引?

如果这些业务键本来就应该是全局唯一的,可以在确认历史数据和上游写入流程都满足约束条件之后再加;没清完残留脏数据就直接加唯一索引,很容易因为冲突直接失败,线上结构变更也要单独评估影响范围。

把“先查再删”固定成清理流程

这类数据去重的核心不是靠某条特殊SQL搞定,而是把业务去重键、保留规则、候选主键清单、实际影响行数和唯一性复查串成一条完整的证据链。后续再遇到导入重跑、接口重试造成的重复数据,先把查询结果拉出来人工审阅一遍,再开事务执行删除,风险会比直接按时间条件盲清理小很多。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
上一篇
Go database/sql 连接池 MaxOpenConns 怎么设:等待队列、连接复用与超时验收
Go sync.Map 适合热点读缓存吗:读写比例、类型断言与基准测试
下一篇
Go sync.Map 适合热点读缓存吗:读写比例、类型断言与基准测试
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • ljg-skills -
    ljg-skills
    ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
    4687次使用
  • MELO音乐 - AI 音乐生成平台,支持多模态创作能力
    MELO音乐
    MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
    4300次使用
  • UniScribe - AI 免费在线音视频转文字平台
    UniScribe
    UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
    4248次使用
  • 剧云 - 免费 AI 智能中文剧本创作平台
    剧云
    剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
    4469次使用
  • 万象有声 - AI 一站式有声内容创作平台
    万象有声
    万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
    4432次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码