当前位置:首页 > 文章列表 > 文章 > php教程 > PHP mbstring 截取多字节文本避免乱码

PHP mbstring 截取多字节文本避免乱码

来源:17golang原创 2026-10-10 19:08:43 0浏览 收藏

PHP 处理中文、日文或 emoji 时,直接使用 substr() 可能把一个 UTF-8 字符从中间切开,结果出现乱码或替代字符。稳定的做法是先确认文本编码,再用 mb_substr($text, $start, $length, 'UTF-8') 按字符位置截取,并用 mb_strlen() 做长度判断。

官方文档:https://www.php.net/manual/zh/book.mbstring.php

只要业务边界是“取前 N 个字符”,就使用 mbstring 的字符级函数;只有在明确处理原始字节或协议数据时,才考虑字节级函数。

PHP 截取中文不乱码的最小写法

UTF-8 中一个中文字符通常由多个字节组成,而 substr() 的偏移量和长度是按字节工作的。mbstring 提供面向多字节字符串的函数,mb_substr() 则按照字符数执行截取,所以更适合文章摘要、昵称、接口提示语等面向用户的文本。

如果运行环境没有加载 mbstring,会出现“Call to undefined function mb_substr()”。Linux 包管理器、Windows 扩展配置和 PHP-FPM 使用的配置文件可能不同,排查时要确认实际运行的 SAPI,而不是只看命令行的 php.ini。

PHP substr 按字节与 mb_substr 按字符保留中文边界的说明图
图1:字符边界说明图,展示 substr 与 mb_substr 的处理层级差异。

start、length 和 encoding 的边界要先约定

mb_substr() 的 start 从 0 开始计数,length 表示最多取多少个字符;省略 length 或传入 null 时,会一直取到字符串末尾。start 可以是负数,表示从字符串尾部倒数定位,这对取文件名后缀前的尾部摘要很方便。

参数作用实践建议
string待截取文本进入函数前统一为 UTF-8
start字符起点,支持负数展示摘要通常从 0 开始
length最大字符数接口字段建议显式传入
encoding字符编码项目代码优先显式写 UTF-8

不要把 mb_substr() 的“字符安全”理解成“语义安全”。它不会自动识别一个组合 emoji、复杂 grapheme cluster 或 HTML 标签。富文本截断应先转为纯文本,涉及用户可见字素时再考虑更专门的分段策略。

按场景选择长度函数和截取边界

列表摘要通常需要“最多 N 个字符”,用 mb_strlen() 判断后再拼接省略号;终端或固定宽度卡片则可能关心中文占两列、英文占一列的显示宽度,这时应考虑 mb_strimwidth(),不能只用字符数代替视觉宽度。

三者的职责可以这样记:mb_strlen() 回答“有多少个字符”,mb_substr() 回答“取哪一段字符”,mb_strimwidth() 回答“在指定显示宽度内保留什么”。数据库字段长度、接口校验长度和前端视觉宽度也应分别定义。

PHP mb_strlen mb_substr mb_strimwidth 区分字符数和显示宽度的结构图
图2:长度与展示边界结构图,区分字符数量和界面显示宽度。

混合文本的检查清单

  • 输入来源明确是 UTF-8,并在函数中显式传入 'UTF-8'。
  • 需要用户可见字符时不用 substr() 直接裁剪中文。
  • 空字符串、start 超出范围、length 为 0 或负数都写入测试用例。
  • 摘要长度与数据库字段限制分开计算,省略号是否占配额要先约定。
  • 界面固定宽度场景用显示宽度函数验证,而不是凭字符数猜测。

最小验证集应包含纯中文、纯英文、中英文混合、emoji、空字符串和尾部截取。这样既能发现乱码,也能提前暴露“字符数量正确但界面仍然溢出”的另一类问题。

常见问题

mb_substr() 省略编码参数可以吗?

可以省略,PHP 会使用内部字符编码;但在多环境部署中显式传入 UTF-8 更容易读懂,也能减少配置差异造成的结果变化。

为什么 mb_strlen() 和 strlen() 得到的数字不同?

strlen() 面向字节,mb_strlen() 在指定编码下按字符统计。中文、emoji 等多字节内容中,两者不同是正常现象。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
filepath.WalkDir 遇到权限目录的错误处理filepath.WalkDir 遇到权限目录的错误处理
上一篇
filepath.WalkDir 遇到权限目录的错误处理
io/fs.ValidPath 校验用户路径的规则
下一篇
io/fs.ValidPath 校验用户路径的规则
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    408次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    484次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    493次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    438次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    266次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码