MySQL JSON_TABLE 如何展开多层数组并保留父级字段
一个 JSON 文档里同时放着订单、商品和批次数组时,最容易写错的不是字段路径,而是层级关系。正确做法是把最外层数组交给 JSON_TABLE() 的行路径,再在对应的 COLUMNS 中逐层嵌套 NESTED PATH。订单号、客户名、商品编码这类父级标量列会自动复制到每一条更深层的结果行,不需要额外回连 JSON。
NESTED PATH的路径相对其父级行源计算,多层数组要按真实父子关系逐层写。- 父级列与子级列放在同一个
JSON_TABLE投影中,子数组展开时父级值会保留并重复。 - 同一
COLUMNS下的兄弟NESTED PATH依次产出行,数量相加,不会自动形成笛卡尔积。
先把三级 JSON 映射成三个行源
假设业务表保存一个订单文档:最外层是 orders[*],每个订单内有 items[*],每个商品内还有 batches[*]。这三个数组不能都从根路径直接找,而要依次相对父级展开。
下面的 JSON 是完整测试数据。JSON 语法本身不支持注释,因此字段含义紧接在代码后说明。
{
"orders": [
{
"order_id": 101,
"customer": "张三",
"items": [
{
"sku": "A-1",
"qty": 2,
"batches": [
{"batch_no": "B01", "warehouse": "华东"},
{"batch_no": "B02", "warehouse": "华南"}
]
},
{
"sku": "B-7",
"qty": 1,
"batches": [
{"batch_no": "B09", "warehouse": "华北"}
]
}
]
}
]
}
order_id 与 customer 属于订单层,sku 与 qty 属于商品层,batch_no 与 warehouse 属于批次层。先把这个边界划清,SQL 基本就不会走偏。

用两层 NESTED PATH 一次展开订单、商品和批次
先创建一张只含主键和 JSON 文档的测试表,再把三级数据写进去。生产环境可以直接把 p.doc 换成真实 JSON 列。
-- 创建最小测试表,避免其他字段干扰观察结果
CREATE TABLE order_payloads (
id BIGINT PRIMARY KEY,
doc JSON NOT NULL
);
-- 写入一份订单、商品、批次三级结构的测试文档
INSERT INTO order_payloads (id, doc) VALUES (
1,
'{"orders":[{"order_id":101,"customer":"张三","items":[{"sku":"A-1","qty":2,"batches":[{"batch_no":"B01","warehouse":"华东"},{"batch_no":"B02","warehouse":"华南"}]},{"sku":"B-7","qty":1,"batches":[{"batch_no":"B09","warehouse":"华北"}]}]}]}'
);
核心查询只有一个原则:每一层 NESTED PATH 都写在父层的 COLUMNS 里面。MySQL 会把当前匹配项作为下一层的行源。
-- 从订单数组开始,每个 orders[*] 元素先生成一条父级行
SELECT
p.id AS payload_id,
jt.order_id,
jt.customer,
jt.item_no,
jt.sku,
jt.qty,
jt.batch_no,
jt.warehouse
FROM order_payloads AS p
JOIN JSON_TABLE(
p.doc,
'$.orders[*]' COLUMNS (
-- 订单层标量列会复制到更深层生成的结果行
order_id BIGINT PATH '$.order_id',
customer VARCHAR(50) PATH '$.customer',
NESTED PATH '$.items[*]' COLUMNS (
-- 商品序号在每个订单的 items 数组内从 1 开始
item_no FOR ORDINALITY,
sku VARCHAR(32) PATH '$.sku',
qty INT PATH '$.qty',
NESTED PATH '$.batches[*]' COLUMNS (
-- 批次路径相对当前商品对象,而不是相对 JSON 根节点
batch_no VARCHAR(32) PATH '$.batch_no',
warehouse VARCHAR(32) PATH '$.warehouse'
)
)
)
) AS jt ON TRUE;
这个查询会得到三行:商品 A-1 对应 B01、B02 两个批次,商品 B-7 对应 B09 一个批次。订单号 101 和客户“张三”会出现在三行中;A-1 的数量 2 会重复两次。这不是数据被重复写入,而是关系结果把父级上下文附着到了每个叶子行。
| order_id | customer | item_no | sku | qty | batch_no | warehouse |
|---|---|---|---|---|---|---|
| 101 | 张三 | 1 | A-1 | 2 | B01 | 华东 |
| 101 | 张三 | 1 | A-1 | 2 | B02 | 华南 |
| 101 | 张三 | 2 | B-7 | 1 | B09 | 华北 |
父级字段为什么能保留下来
MySQL 8.4 手册把 NESTED PATH 描述为:把嵌套对象或数组展平成行,并把父对象或父数组中的 JSON 值放在同一行。路径的基准也会逐层变化:顶层路径相对输入文档,第一层 NESTED PATH 相对订单行源,第二层则相对商品行源。
因此,父级字段是否保留,取决于它是否在正确的作用域里被定义,而不是取决于 SELECT 是否再次提取它。可以按下面的速查关系理解:
| 定义位置 | 字段示例 | 展开后的表现 |
|---|---|---|
| 订单层 COLUMNS | order_id、customer | 对订单下所有商品和批次行重复 |
| 商品层 COLUMNS | item_no、sku、qty | 对该商品下所有批次行重复 |
| 批次层 COLUMNS | batch_no、warehouse | 每个匹配批次生成自己的值 |
FOR ORDINALITY 用来辨认同值父记录
如果多个父对象的业务字段恰好相同,只看 sku 或名称可能无法判断叶子行来自哪个数组元素。FOR ORDINALITY 会在当前 COLUMNS 作用域内从 1 计数,适合补一列结构序号。
-- 同时记录订单、商品和批次在各自数组中的位置
SELECT jt.order_no, jt.item_no, jt.batch_no_in_item,
jt.order_id, jt.sku, jt.batch_code
FROM order_payloads AS p
JOIN JSON_TABLE(
p.doc,
'$.orders[*]' COLUMNS (
order_no FOR ORDINALITY,
order_id BIGINT PATH '$.order_id',
NESTED PATH '$.items[*]' COLUMNS (
item_no FOR ORDINALITY,
sku VARCHAR(32) PATH '$.sku',
NESTED PATH '$.batches[*]' COLUMNS (
batch_no_in_item FOR ORDINALITY,
batch_code VARCHAR(32) PATH '$.batch_no'
)
)
)
) AS jt ON TRUE;
序号只表示当前 JSON 数组中的位置,不应该直接当作长期稳定的业务主键。真正需要回写或去重时,仍应使用订单 ID、商品 ID、批次 ID 等业务标识。
兄弟 NESTED PATH 不会自动形成笛卡尔积
另一个常见误区,是把同一对象下两个数组写成同级兄弟 NESTED PATH,然后期待两组元素两两组合。MySQL 的实际语义不是这样:同一个 COLUMNS 里的兄弟子句会依次处理,一边产出行时,另一边的列为 NULL。总行数是各兄弟子句产生行数的和,不是乘积。

例如一个商品同时有 sizes[*] 和 colors[*],分别包含 2 个和 3 个元素。把它们写成兄弟子句会得到 5 行,而不是 6 种组合。如果业务确实需要尺寸与颜色的组合,应先确认 JSON 是否表达了这种关系,再显式使用两次 JSON_TABLE() 或关系表连接,不能依赖兄弟子句隐式相乘。
空数组和缺失字段怎么处理
当某个 NESTED PATH 没有匹配项时,MySQL 会保留父级行,并把该嵌套层的列补成 NULL。这相当于父级与嵌套层之间的外连接语义。是否保留这类行,要根据业务目标决定。
-- 只保留真正存在批次的叶子行,相当于把最深层改成内连接效果
SELECT jt.order_id, jt.sku, jt.batch_no
FROM order_payloads AS p
JOIN JSON_TABLE(
p.doc,
'$.orders[*]' COLUMNS (
order_id BIGINT PATH '$.order_id',
NESTED PATH '$.items[*]' COLUMNS (
sku VARCHAR(32) PATH '$.sku',
NESTED PATH '$.batches[*]' COLUMNS (
batch_no VARCHAR(32) PATH '$.batch_no'
)
)
)
) AS jt ON TRUE
WHERE jt.batch_no IS NOT NULL;
如果需要区分“字段不存在”和“字段存在但值为空”,可以增加 EXISTS PATH 列。标量缺失时,普通 PATH 列默认使用 NULL ON EMPTY;只有业务明确要求遇到缺失立即失败时,才考虑 ERROR ON EMPTY。
生产查询先估算展开后的行数
JSON_TABLE() 解决的是投影和展开,不会替你控制数据规模。一条订单包含 20 个商品,每个商品 10 个批次,单个文档就可能产出 200 行。文档数量再放大后,排序、聚合和后续连接的成本会迅速上升。
- 先在来源表上用主键、时间范围、租户或状态缩小文档集合,再调用
JSON_TABLE()。 - 只投影查询真正需要的列,并为每列选择合适的数据类型,避免无意义的大字符串转换。
- 在测试环境统计订单、商品、批次数组的最大值与常见值,按层级基数乘积估算最坏行数。
- 如果查询长期依赖同一批字段做过滤、连接和聚合,考虑把稳定业务实体规范化到关系表,而不是每次在线展开整个 JSON。
常见问题
NESTED PATH 可以嵌套多少层?
语法允许继续嵌套,但层数越深,路径维护和结果行数越难控制。工程上应以真实数据层级为准,并提前测量最坏展开规模。
为什么父级字段看起来被重复了?
因为每个叶子元素都要成为独立关系行,父级值必须随行携带。这是正常投影结果,不代表源 JSON 中产生了重复数据。
空数组为什么仍然出现一行 NULL?
NESTED PATH 没有匹配时会生成 NULL 补行,以保留父级。若只要有实际子元素的行,在外层查询增加对应子列的非空条件。
两个兄弟数组如何做全组合?
不要指望兄弟 NESTED PATH 自动相乘。应分别展开两个数组,再用明确的连接条件组合;如果没有自然连接条件,先确认业务是否真的需要笛卡尔积。
JSON_TABLE 的别名可以省略吗?
不可以。它作为表函数出现在 FROM 中,必须提供表别名,例如示例中的 AS jt。
把复杂 JSON 当成分层行源来读
多层数组展开的关键不在于堆更多 JSON 路径,而在于让每一级路径待在正确的父级作用域。先画出 orders[*] → items[*] → batches[*] 的父子关系,再把标量列放回所属层级,父级字段就会自然保留。最后补上序号、空数组策略和行数预算,这条查询才适合从演示走向真实业务。
runtime/secret 如何保存短生命周期的令牌字节
- 上一篇
- runtime/secret 如何保存短生命周期的令牌字节
- 下一篇
- runtime/secret 为什么不能替代完整的密钥管理系统
-
- 数据库 · MySQL | 4小时前 | MySQL · 执行计划 · 性能排查 · explain 执行计划 统计信息 ANALYZE TABLE MySQL Histogram
- MySQL Histogram 统计信息过期会怎样影响执行计划
- 145浏览 收藏
-
- 数据库 · MySQL | 6小时前 | MySQL · 索引优化 · mysql explain 不可见索引 索引回归 Performance Schema
- MySQL 不可见索引适合怎样做上线前回归验证
- 422浏览 收藏
-
- 数据库 · MySQL | 8小时前 |
- Optimizer Trace 适合解决哪些执行计划疑问
- 480浏览 收藏
-
- 数据库 · MySQL | 13小时前 | MySQL · InnoDB · 批量插入 MySQL 批量写入 InnoDB事务 事务大小 回滚成本
- 批量写入如何兼顾吞吐与回滚成本:事务大小实测方法
- 160浏览 收藏
-
- 数据库 · MySQL | 19小时前 |
- GTID 复制切换前要检查什么:一致性与故障回退清单
- 153浏览 收藏
-
- 数据库 · MySQL | 1天前 |
- 间隙锁何时出现:用范围更新解释幻读保护边界
- 313浏览 收藏
-
- 数据库 · MySQL | 1天前 |
- 死锁日志怎么看:还原事务交叉加锁的最短路径
- 351浏览 收藏
-
- 数据库 · MySQL | 1天前 | MySQL教程 · ROW_NUMBER MySQL窗口函数 DENSE_RANK 分组排名 每组TopN
- 窗口函数做分组排名时,ROW_NUMBER 与 DENSE_RANK 怎么选
- 112浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 385次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 462次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 473次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 410次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 237次使用
-
- 接口返回 200 但前端仍报错怎么办:从响应格式到跨域一步步排查
- 2026-06-14 332浏览
-
- MySQL 明明加了索引,为什么查询还是很慢?先查这 6 个点
- 2026-06-27 374浏览
-
- golang MySQL实现对数据库表存储获取操作示例
- 2022-12-22 499浏览
-
- golang 基于 mysql 简单实现分布式读写锁
- 2023-01-07 384浏览
-
- 详解如何利用GORM实现MySQL事务
- 2023-01-07 184浏览

