当前位置:首页 > 文章列表 > 数据库 > MySQL > MySQL 多值索引怎么查询 JSON 数组成员

MySQL 多值索引怎么查询 JSON 数组成员

来源:17golang原创 2026-09-28 02:51:40 0浏览 收藏

订单表里有一个 JSON 字段 profile,其中 zip_codes 是数组。查询某个邮编时,如果直接写 JSON 条件,执行计划往往仍是全表扫描。MySQL 8.0.17 及以上的 InnoDB 可以用多值索引,把数组里的每个标量值建立成索引记录,再让成员查询走索引。

官方文档:https://dev.mysql.com/doc/refman/8.4/en/create-index.html

核心做法是:先用 MEMBER OF()、JSON_CONTAINS() 或 JSON_OVERLAPS() 表达数组匹配,再对同一 JSON 路径建立 CAST(... AS ... ARRAY) 多值索引,最后用 EXPLAIN 检查目标索引是否出现在执行计划中。

下面用 customers.profile->'$.zip_codes' 作为示例,重点是查询形态和索引边界,不依赖特定业务表名。

先确认查询形态:你查的是数组成员

多值索引服务的是“数组里是否包含某个值”,不是任意 JSON 文档搜索。假设数据类似 {"zip_codes":[310000,310001]},单个邮编可以这样写:

-- 用标量匹配 JSON 数组中的一个成员
SELECT id, profile
FROM customers
WHERE 310001 MEMBER OF (profile->'$.zip_codes');

-- 多个候选值至少命中一个时,使用 JSON_OVERLAPS
SELECT id
FROM customers
WHERE JSON_OVERLAPS(profile->'$.zip_codes', JSON_ARRAY(310001, 310002));

MEMBER OF() 适合单个成员,JSON_CONTAINS() 适合要求候选数组全部包含,JSON_OVERLAPS() 适合两个数组存在交集。不要只把 JSON_EXTRACT() 包在函数里就期待索引一定生效,优化器要识别出支持的搜索函数和对应路径。

MySQL JSON 数组成员查询与多值索引的静态关系说明图
图1:说明图,展示 JSON 数组、成员查询函数和多值索引之间的静态关系,不是数据库截图或运行证据。

用 CAST ARRAY 创建多值索引

索引表达式必须把 JSON 数组转换成明确的 SQL 类型数组。整数邮编可以使用 UNSIGNED ARRAY;如果数组存的是字符串,就应选择合适的字符类型,并保持写入数据类型一致。

-- 对 zip_codes 数组建立多值索引;路径必须和查询保持一致
ALTER TABLE customers
  ADD INDEX idx_zip_codes (
    (CAST(profile->'$.zip_codes' AS UNSIGNED ARRAY))
  );

-- 统计持久化开启时,建索引后刷新优化器统计信息
ANALYZE TABLE customers;

它不是把整个 JSON 文档当成一个值,而是让一行数据对应多个索引记录。这样查询 310001 时,索引可以先定位包含该元素的行,再回表读取完整 profile。如果要做联合索引,只能放一个多值键部件;例如可以把 tenant_id 作为普通键部件,但不能在同一个索引里放两个数组表达式。

用 EXPLAIN 判断索引是否真的命中

建完索引不要只看 DDL 成功。用和线上完全相同的谓词检查执行计划:

-- 查看单成员查询是否选择目标索引
EXPLAIN SELECT id
FROM customers
WHERE 310001 MEMBER OF (profile->'$.zip_codes');

重点观察 key 是否为 idx_zip_codes,访问类型是否从 ALL 变为更有选择性的索引访问,以及 rows 估算是否明显下降。测试数据很少时,优化器可能认为全表扫描更便宜;这不等于索引定义无效,应使用接近生产分布的数据,并结合实际查询条件复查。

多值索引不是覆盖索引,查询仍可能回表;它也不支持范围扫描、排序或仅靠索引返回所有列。目标是减少“按数组成员找行”的过滤成本,而不是让所有 JSON 查询都变快。

MySQL 多值索引的查询访问和边界关系说明图
图2:结构说明图,展示索引查找、回表和空值/类型边界的关系,不是 EXPLAIN 截图。

排查空数组、NULL 与类型不一致

这类索引最容易在数据边界上“看起来不生效”。空数组不会产生索引记录,因此对应行不能通过该索引扫描找到;生成结果为 SQL NULL 时会形成 NULL 索引记录,而 JSON 数组中的 JSON null 不允许作为多值索引元素。整数 310001 和字符串 "310001" 也不是同一个匹配值,不能靠隐式转换补救。

上线前建议把检查写成清单:

检查项判断处理
数组元素类型是否始终为数字或始终为字符串统一写入格式,并让 CAST 类型匹配
空数组比例是否存在大量无元素记录评估索引收益,必要时增加普通过滤条件
查询函数是否使用三种可优化函数改写后再用 EXPLAIN 对比
建索引方式是否接受 COPY 算法与 DML 成本低峰期灰度执行并准备回滚

结论与两个常见追问

MySQL 多值索引适合“JSON 数组成员定位”这一窄场景:查询函数、JSON 路径、CAST 类型三者要对应,执行计划要实测,数据边界要提前清理。若需求是复杂对象过滤、范围排序或覆盖读取,应该重新评估关系表拆分或生成列方案,而不是继续堆叠多值索引。

为什么索引存在但 EXPLAIN 仍显示 ALL?

常见原因是数据量小、谓词未使用支持的函数、路径或类型不一致,或者统计信息过旧。先核对表达式,再用接近生产规模的数据和 ANALYZE TABLE 后的计划复查。

JSON 数组里能放对象吗?

多值索引适合可转换为同一 SQL 标量类型的数组元素。数组对象的字段过滤通常需要不同的数据建模方式,不能直接把任意对象结构当成一个可排序的多值键。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go slog.LogValuer 怎么延迟展开业务对象Go slog.LogValuer 怎么延迟展开业务对象
上一篇
Go slog.LogValuer 怎么延迟展开业务对象
Go fs.WalkDir 返回 SkipDir 与 SkipAll 有什么区别
下一篇
Go fs.WalkDir 返回 SkipDir 与 SkipAll 有什么区别
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    246次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    292次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    261次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    242次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    50次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码