当前位置:首页 > 文章列表 > 数据库 > MySQL > REGEXP_LIKE 中文排序规则怎么配置或排查

REGEXP_LIKE 中文排序规则怎么配置或排查

来源:17golang原创 2026-09-13 11:22:20 0浏览 收藏

我第一次把 REGEXP_LIKE() 用到中文字段时,误以为“排序规则”只影响 ORDER BY。真正让结果忽然变成 0 的,往往是表达式和模式没有使用同一套字符集/排序规则,或者 match_type 覆盖了默认的大小写行为。解决思路是:先统一 utf8mb4,再显式写 COLLATE,最后用函数和元数据查实际生效配置。

官方地址:https://dev.mysql.com/doc/refman/8.4/en/

要点速览
  • REGEXP_LIKE() 返回 1、0 或 NULL,排序规则影响字符比较,不负责结果集排序。
  • 中文场景优先使用 utf8mb4,需要中文语言规则时可检查并选择 utf8mb4_zh_0900_as_cs
  • 异常排查要同时看列定义、连接变量、表达式上的 COLLATEmatch_type

为什么 REGEXP_LIKE 的结果会受排序规则影响

MySQL 8.4 文档规定,正则操作默认使用 exprpat 参数的字符集和排序规则来判断字符类型并比较。这里的“排序规则”更接近比较规则,不是把查询结果按拼音或笔画排序。正则表达式先决定模式如何解释,再在这套字符比较规则下判断是否匹配。

REGEXP_LIKE 表达式和模式之间的中文字符集排序规则比较边界示意图
图1:REGEXP_LIKE 的表达式与模式比较边界示意图;排序规则作用于字符比较,不是对结果集排序。

如果数据列是 utf8mb4,但模式来自另一个字符集的字面量,MySQL 会按表达式的排序规则优先级和强制性规则处理,结果可能和“看起来相同的中文”不一致。不要只改数据库默认值就认为所有查询已修复。

先用 utf8mb4 和显式 COLLATE 固定比较规则

迁移旧表时,我会先把候选排序规则列出来,再选一套和业务要求一致的规则。_ci 表示不区分大小写,_cs 表示区分大小写;中文本身没有英文字母大小写,但同一查询里混合英文、数字或符号时仍会受到影响。

-- 先确认当前服务器是否提供目标中文排序规则
SHOW COLLATION LIKE 'utf8mb4%zh%';

-- 两端都显式指定同一套字符集与排序规则,避免依赖隐式继承
SELECT REGEXP_LIKE(
  _utf8mb4'订单中文' COLLATE utf8mb4_zh_0900_as_cs,
  _utf8mb4'订单' COLLATE utf8mb4_zh_0900_as_cs
) AS matched;

-- 不需要语言特定规则时,也可用通用 UCA 规则做明确比较
SELECT REGEXP_LIKE(
  _utf8mb4'Order订单' COLLATE utf8mb4_0900_ai_ci,
  _utf8mb4'order' COLLATE utf8mb4_0900_ai_ci,
  'i' -- i 明确要求忽略大小写,便于和默认行为区分
) AS matched;

若服务器没有目标规则,不要把名称硬写进生产 SQL;根据 SHOW COLLATION 的结果选择可用项。MySQL 官方也建议尽量使用 utf8mb4,而 utf8 在当前版本中是已弃用的 utf8mb3 别名。

按顺序排查列定义、连接设置和 match_type

结果不符合预期时,先确认数据真的以预期字符集存储,再看连接协商出来的规则,最后才看语句里的覆盖项。下面三组查询不会修改数据,适合放进迁移前后的回归记录。

排查 REGEXP_LIKE 中文匹配时的列定义连接设置和表达式节点关系示意图
图2:排查中文匹配异常时的配置节点关系示意图;各节点表示检查对象,不表示执行流程。
-- 查看连接层实际采用的字符集与排序规则
SELECT @@character_set_connection AS charset_conn,
       @@collation_connection AS collation_conn;

-- 查看目标列的真实定义,不要凭数据库默认值猜测
SELECT COLUMN_NAME, CHARACTER_SET_NAME, COLLATION_NAME
FROM INFORMATION_SCHEMA.COLUMNS
WHERE TABLE_SCHEMA = DATABASE()
  AND TABLE_NAME = 'orders'
  AND COLUMN_NAME = 'title';

-- 查看本次表达式两端最终使用的排序规则
SELECT COLLATION(_utf8mb4'订单中文') AS expr_collation,
       COLLATION(_utf8mb4'订单') AS pat_collation;

随后检查 match_typec 强制大小写敏感,i 强制大小写不敏感;如果同一个参数串里出现冲突选项,靠后的选项优先。二进制字符串则按二进制、大小写敏感方式处理,即使写了 i 也不能按普通文本理解。

用最小样例做迁移回归,不要只测一条中文

迁移后至少覆盖精确中文片段、混合英文大小写、NULL 和二进制输入。尤其要保留 NULL 断言,因为 exprpat 为 NULL 时,函数结果不是 0,而是 NULL。

-- 用固定输入覆盖命中、未命中和 NULL 三种返回值
SELECT
  REGEXP_LIKE(_utf8mb4'华东订单', _utf8mb4'订单') AS hit_cn,
  REGEXP_LIKE(_utf8mb4'Order', _utf8mb4'order', 'c') AS hit_case_sensitive,
  REGEXP_LIKE(_utf8mb4'Order', _utf8mb4'order', 'i') AS hit_case_insensitive,
  REGEXP_LIKE(NULL, _utf8mb4'订单') AS null_input;

-- 确认表达式级 COLLATE 能独立于连接默认值工作
SELECT REGEXP_LIKE(
  title COLLATE utf8mb4_zh_0900_as_cs,
  _utf8mb4'订单' COLLATE utf8mb4_zh_0900_as_cs
) AS matched
FROM orders
WHERE id = 1; -- 只取一条固定样本,便于迁移前后对照

如果旧环境使用的是 REGEXPRLIKE,不要直接把它们的历史结果当成 REGEXP_LIKE() 的保证。MySQL 文档还特别提醒,旧的正则运算符存在多字节字符集限制;升级时应重新跑中文样例,而不是只比较 SQL 文本。

相关问题

改了数据库默认排序规则,为什么 REGEXP_LIKE 仍然不变?

数据库默认值只影响未被更具体层级覆盖的对象;列定义、连接设置、字面量字符集和表达式级 COLLATE 都可能继续生效。用 INFORMATION_SCHEMA.COLUMNS、系统变量和 COLLATION() 实测。

中文匹配应该选 _ci 还是 _cs?

如果模式中的英文大小写需要视为同一类,选不区分大小写的规则或显式使用 i;如果要严格区分,选 _cs 或显式使用 c。中文业务仍应以代表性数据回归,而不要只凭后缀做判断。

迁移清单

  • 确认列和连接都使用 utf8mb4,不要新增依赖已弃用 utf8mb3 的写法。
  • 两端显式统一 COLLATE,并记录选择该规则的业务原因。
  • ci、NULL、混合中英文加入回归样例。
  • REGEXP/RLIKE 迁移到 REGEXP_LIKE() 时重新验证多字节中文输入。
版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Lovart新手怎么做第一个网页布局?从需求简报到HTML导出Lovart新手怎么做第一个网页布局?从需求简报到HTML导出
上一篇
Lovart新手怎么做第一个网页布局?从需求简报到HTML导出
Go xmlattr 怎么处理属性字段
下一篇
Go xmlattr 怎么处理属性字段
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    111次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    31次使用
  • OpenCompass大模型评测体系详解:功能、使用指南与应用场景
    OpenCompass
    OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
    49次使用
  • AGI-Eval大模型评测平台:权威榜单、数据集与人机协同评测方案
    AGI-Eval
    AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
    30次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    265次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码