当前位置:首页 > 文章列表 > 数据库 > MySQL > MySQL JSON_OVERLAPS 判断数组交集的查询方案

MySQL JSON_OVERLAPS 判断数组交集的查询方案

来源:17golang原创 2026-09-28 23:37:49 0浏览 收藏

把标签、权限或适用范围存成 JSON 数组后,最常见的查询不是“一个数组是否完整包含另一个数组”,而是“两个数组有没有至少一个共同值”。这时用 JSON_OVERLAPS() 更贴合语义:数组有交集返回 1,没有交集返回 0。

官方文档:https://dev.mysql.com/doc/refman/8.4/en/

要点速览
  • JSON_OVERLAPS(a, b) 判断是否至少共享一个数组元素,适合“命中任一标签”的筛选。
  • 它和 JSON_CONTAINS() 的 AND/OR 语义不同,数字 6 与字符串 "6" 也不会自动转换。
  • 先处理 NULL、空数组、嵌套值,再用 EXPLAIN 判断 InnoDB 多值索引是否真的被采用。

先把“有交集”与“完全包含”分开

假设商品表的 tags 列保存 ["mysql", "json", "index"],页面传入的筛选标签是 ["json", "redis"]。两边虽然不完全相同,但共同值是 json,所以这条商品应当命中。

JSON_OVERLAPS() 的判断重点是“至少一个共同元素”。如果业务要求查询数组里的每一项都在商品数组中,则应考虑 JSON_CONTAINS();不要只把函数名换掉后期待结果一致。

用 JSON_OVERLAPS 写出数组交集查询

查询参数应保持 JSON 数组形状,SQL 中可以用 JSON_ARRAY() 构造一组标量值。下面的表结构和查询只演示语义,实际项目还要根据字段长度、数据量和写入频率决定是否把标签拆成关联表。

-- 建立保存商品标签的最小示例,tags 必须是合法 JSON
CREATE TABLE product_catalog (
    id BIGINT PRIMARY KEY,
    name VARCHAR(120) NOT NULL,
    tags JSON NOT NULL
);

-- 任意命中 json 或 redis 的商品都会返回
SELECT id, name, tags
FROM product_catalog
WHERE JSON_OVERLAPS(tags, JSON_ARRAY('json', 'redis'));

-- 外部参数已经是 JSON 数组时,直接作为第二个文档传入
SELECT id, name
FROM product_catalog
WHERE JSON_OVERLAPS(tags, CAST('["json", "redis"]' AS JSON));

第一种写法适合固定数量的参数,第二种适合应用层已经完成 JSON 编码的筛选条件。生产代码中不要把未校验的字符串直接拼接进 SQL;参数绑定既能避免引号问题,也能减少把非法 JSON 带入查询的风险。

MySQL JSON_OVERLAPS 比较商品 tags 数组与查询数组并返回共同元素结果的结构说明图
图1:JSON_OVERLAPS 判断两个 JSON 数组是否存在共同元素的结构说明图,不是截图或运行证据。

类型、对象和空值是最容易误判的地方

JSON 比较不会把数字和字符串随意当成同一个值。比如数组中是数字 6,查询参数写成字符串 "6",两者不构成交集。对象比较则看共同的键值对;嵌套数组也按完整元素比较,外层数组中出现部分数字,不代表与另一个嵌套数组部分重叠。

另外,任一参数为 NULL 时结果也是 NULL,不是布尔值 0。空数组与任何数组都没有元素交集,通常得到 0。如果业务把 NULL 当成“没有标签”,可以显式归一化:

-- 用 COALESCE 把 NULL 统一成空数组,再进行交集判断
SELECT id,
       COALESCE(JSON_OVERLAPS(tags, CAST(? AS JSON)), 0) AS has_overlap
FROM product_catalog;

-- 这个例子提醒类型必须一致:数字 6 与字符串 "6" 不相等
SELECT JSON_OVERLAPS('[4, 5, 6]', '[6]') AS number_hit,
       JSON_OVERLAPS('[4, 5, 6]', '["6"]') AS string_miss;

在接口层最好先约定标签统一使用字符串,权限编号统一使用数字,并在入库时执行一次清洗。这样比在每条查询里尝试转换类型更容易维护。

多值索引只能解决性能,不能修正语义

当 JSON 数组存储在 InnoDB 表中、查询条件稳定且数据量足够大时,可以评估多值索引。它针对数组元素建立索引,不等于普通 JSON 列自动获得了一个万能索引;对象路径、复杂表达式和不匹配的写法仍可能无法利用索引。

-- 为 JSON 数组中的字符串元素建立多值索引
CREATE INDEX idx_product_tags
ON product_catalog ((CAST(tags->'$[*]' AS CHAR(32) ARRAY)));

-- 先观察优化器是否选择索引,再决定是否保留它
EXPLAIN
SELECT id
FROM product_catalog
WHERE JSON_OVERLAPS(tags, JSON_ARRAY('json', 'redis'));

检查执行计划时关注访问类型、候选索引和实际扫描规模。若数组很长、候选值很多,索引收益未必稳定;若标签本身是高频更新且查询模式多变,独立的商品标签关系表可能更直观。我的实践顺序是先用小数据验证 1/0/NULL 语义,再用真实分布评估计划,避免为了一个函数过早改表结构。

MySQL JSON_OVERLAPS 的类型精确匹配、NULL、嵌套数组和 InnoDB 多值索引边界说明图
图2:JSON_OVERLAPS 的类型与索引边界说明图,帮助区分语义问题和性能问题。

常见问题

JSON_OVERLAPS 能判断数组必须全部匹配吗?

不能。它只需要找到一个共同元素;要求查询数组全部被包含时,应改用 JSON_CONTAINS 或重新建模。

为什么数字 6 和字符串 "6" 没有命中?

JSON_OVERLAPS 按 JSON 类型比较,不会替你做字符串到数字的隐式转换。入库和查询参数要统一类型。

JSON_OVERLAPS 返回 NULL 应该怎么处理?

先判断业务是否把 NULL 解释为“没有标签”。若是,可以用 COALESCE 转成 0;若 NULL 表示数据缺失,则应保留并单独告警。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go bufio.Reader Peek 预读协议头的参数边界Go bufio.Reader Peek 预读协议头的参数边界
上一篇
Go bufio.Reader Peek 预读协议头的参数边界
Go TLS 握手因 ALPN 不匹配失败的定位方案
下一篇
Go TLS 握手因 ALPN 不匹配失败的定位方案
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    256次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    301次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    276次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    257次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    62次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码