MySQL 8.4 采样率怎么看:直方图统计的复查与回退
线上订单列表突然从 80 毫秒涨到 1.8 秒,索引没动,SQL 语句也没改。把同一条查询拿到测试库排查,发现优化器把 status = 'PAID' 的行数估算成了接近全表一半,可真实业务里支付完成的订单占比非常小。这时候盲目新建额外索引,本质上是在和错误的基数估算死磕,很难从根上解决问题。
要点速览
- MySQL 8.4 直方图补充的是列值分布信息,不能替代合适的索引。
- 用 ANALYZE TABLE orders UPDATE HISTOGRAM ON status WITH 32 BUCKETS 生成统计,再从 INFORMATION_SCHEMA.COLUMN_STATISTICS 查看结果。
- 先核对 sampling-rate 和 EXPLAIN 的估算变化,再决定保留、重建还是删除。
- JSON 列、临时表、空间类型和单列唯一索引覆盖的列不适用这套直方图。
为什么索引没变,执行计划却会选错
优化器选执行计划的时候,本身不知道每个值在表里具体出现多少次,它要靠索引基数和列统计来估算过滤后的返回行数。订单表里的 status 是典型的偏斜列:PENDING 待支付状态可能占绝大多数,REFUNDED 退款状态只有很少记录。如果统计信息把每个状态的出现概率按均匀分布计算,某个状态的行数估算就会和真实值差得很远。
可以把问题拆成两个独立部分:索引能不能快速定位候选行,以及优化器知不知道这些候选行大概有多少。直方图只负责处理第二件事,它不是“一键让索引变快”的开关,也不该当成无条件做的性能调优动作。

先用 EXPLAIN 记录错误估算的基准状态
假设订单表已经建了 idx_orders_status_created 联合索引,业务查询只取最近一段时间的已支付订单:
EXPLAIN FORMAT=JSON SELECT id, user_id, paid_at FROM orders WHERE status = 'PAID' AND paid_at >= '2026-08-01' ORDER BY paid_at DESC LIMIT 50;
不要只盯着输出里的 key 字段判断对错。把 rows_examined_per_scan、过滤比例和实际抽样得到的真实行数一起记录下来,尤其要保存生成统计信息前后完全相同的执行计划。如果计划只是偶尔抖动,先确认表数据是不是刚做完大批量导入、归档或者全量状态迁移,别上来就直接调整桶数。
用 ANALYZE TABLE 生成列直方图
MySQL 8.4 支持通过单条 ANALYZE TABLE 语句直接管理列直方图。下面先给 status 字段生成 32 个桶的统计信息:
ANALYZE TABLE orders UPDATE HISTOGRAM ON status WITH 32 BUCKETS;
不手动指定桶数时默认是 100,允许的范围是 1 到 1024。桶数不是越大越好:状态值本身很少的场景下,32 个桶已经足够覆盖分布特征;对高基数列盲目拉高桶数,不仅会拖慢统计生成的速度,后续排查问题也会变得更繁琐。
生成操作返回成功,不代表执行计划一定会变好。下一步要确认统计对象真的已经写入数据字典:
SELECT SCHEMA_NAME, TABLE_NAME, COLUMN_NAME,
HISTOGRAM->>'$."histogram-type"' AS histogram_type,
HISTOGRAM->>'$."sampling-rate"' AS sampling_rate,
HISTOGRAM->>'$."number-of-buckets-specified"' AS bucket_count
FROM INFORMATION_SCHEMA.COLUMN_STATISTICS
WHERE TABLE_NAME = 'orders'
AND COLUMN_NAME = 'status';
sampling-rate 低时,先别急着采信统计结果
直方图生成过程中可能因为内存上限限制触发采样。sampling-rate 等于 1,代表这次生成是全量读取了整列数据;小于 1,说明统计是基于部分样本生成的,极少数分布极稀疏的状态值可能没有被充分捕捉到。大表上出现采样本身不一定是错误,但需要结合业务实际分布一起判断合理性。
可以把统计结果、生成时间和对应的核心查询计划存到内部变更记录里,等业务低峰期再重复一次生成动作。如果两次生成得到的桶分布差异很大,要先检查数据是不是还在高速写入变化,或者缩小范围换一个分布更稳定的候选列做验证,不要直接把生产环境的桶数调到 1024。

什么时候应该删除直方图回退到原有状态
如果更新统计后执行计划没有改善,甚至导致之前稳定的热门查询频繁切换访问路径,可以先保留完整的变更记录,再删除对应列的直方图回到之前的状态:
ANALYZE TABLE orders DROP HISTOGRAM ON status;
删除后重新查询 INFORMATION_SCHEMA.COLUMN_STATISTICS,确认该列的直方图记录已经完全消失,再用完全相同的 EXPLAIN 语句做前后对比。这个回退操作只会移除直方图统计,不会删除已有的索引,也不会改动订单表里的任何业务数据。
还有一个很容易混淆的点:直方图更新和普通的 ANALYZE TABLE orders 不是同一个操作。前者是专门管理指定列的分布统计,后者主要更新表和全量索引的基础统计信息。遇到索引基数过期的场景,不能只靠直方图去掩盖基础统计的问题。
这些列不适合直接生成直方图
- JSON 列原生不支持生成直方图;如果要筛选 JSON 路径里的字段,应该先评估生成列搭配普通索引的方案。
- 临时表、空间类型字段和加密表不能按这套流程生成直方图。
- 被单列唯一索引覆盖的列,本身选择性已经是100%,完全没必要再用直方图额外描述。
- 大批量数据变更之后,统计信息很可能很快就过时,要把直方图重建动作放进大表数据变更后的固定维护流程。
这些限制直接决定了排查的先后顺序:先确认列类型和已有索引的属性,再决定要不要做直方图统计实验;不要把每一次“行数估算不准”都直接归因为缺少直方图。
常见问题
直方图会替代索引吗?
不会。它只补充列值分布信息,帮优化器更准确估算过滤后的返回行数;实际数据的访问路径还是要靠索引或者全表扫描来完成。
桶数应该设置多少?
从能表达业务分布特征的较小值开始测试就行。低基数的状态类列可以先从16或32开始观察效果,高基数列再结合 sampling-rate 和执行计划的稳定性逐步调整。
为什么生成直方图成功,查询还是慢?
可能瓶颈在排序、回表、锁等待或者磁盘随机读,根本不是行数估算的问题。用完全相同的执行计划和慢查询指标拆开逐层验证,不要只盯着直方图是否存在找原因。
删除直方图会丢数据吗?
不会。DROP HISTOGRAM 只删除对应的列统计信息,索引、表数据和后续的业务写入完全不会受到影响。
把统计修正变成可回退的小实验
一套稳妥的操作顺序是:先保存原始的EXPLAIN计划,生成小桶数的直方图,核对 COLUMN_STATISTICS 里的内容和 sampling-rate 参数,再在完全相同的数据条件下复查执行计划和实际耗时。只有估算更贴近真实值、计划更稳定、全链路业务指标没有副作用时,才把它纳入长期维护流程;否则直接删除直方图,回到索引和SQL本身继续排查问题。
MySQL 8.4 直方图怎么修正错误估算:ANALYZE TABLE 与采样率核对
- 上一篇
- MySQL 8.4 直方图怎么修正错误估算:ANALYZE TABLE 与采样率核对
- 下一篇
- Go 1.27 默认启用 stdversion:go.mod 版本边界与 CI 告警怎么处理
-
- 数据库 · MySQL | 1天前 |
- MySQL 事务死锁日志对应索引与访问顺序的排查
- 401浏览 收藏
-
- 数据库 · MySQL | 2天前 | 执行计划 · MySQL教程 · mysql 执行计划 索引优化 访问路径 EXPLAIN FORMAT=JSON
- MySQL EXPLAIN FORMAT=JSON 读取访问路径的操作清单
- 243浏览 收藏
-
- 数据库 · MySQL | 2天前 |
- MySQL 函数索引提取表达式结果的设计方法
- 228浏览 收藏
-
- 数据库 · MySQL | 2天前 |
- MySQL Optimizer Trace 怎么查看索引选择原因
- 500浏览 收藏
-
- 数据库 · MySQL | 2天前 |
- MySQL LATERAL 派生表怎么引用前面的表
- 252浏览 收藏
-
- 数据库 · MySQL | 2天前 |
- MySQL Hash Join 什么时候会消耗大量内存
- 488浏览 收藏
-
- 数据库 · MySQL | 3天前 |
- MySQL Clone 插件怎么为副本准备一致数据
- 184浏览 收藏
-
- 数据库 · MySQL | 3天前 |
- MySQL 动态 redo 日志容量怎么设置
- 153浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 279次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 334次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 328次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 299次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 118次使用
-
- MySQL 明明加了索引,为什么查询还是很慢?先查这 6 个点
- 2026-06-27 374浏览
-
- 接口列表页越查越慢怎么办:N+1 查询从 120 次降到 3 次
- 2026-06-29 180浏览
-
- golang MySQL实现对数据库表存储获取操作示例
- 2022-12-22 499浏览
-
- golang 基于 mysql 简单实现分布式读写锁
- 2023-01-07 384浏览
-
- 详解如何利用GORM实现MySQL事务
- 2023-01-07 184浏览
