当前位置:首页 > 文章列表 > 文章 > php教程 > PHP mb_substr 截断中文时如何避免半个字符

PHP mb_substr 截断中文时如何避免半个字符

来源:17golang原创 2026-09-08 22:12:34 0浏览 收藏

中文标题被截成半个字符,通常不是数据库把内容弄坏了,而是把 UTF-8 字符串交给了按字节工作的函数。处理中文摘要、昵称或列表标题时,直接用 mb_substr(),并显式传入 UTF-8,就能按字符位置截取;长度判断则配套使用 mb_strlen(),不要用 strlen() 代替。

安全写法是 mb_substr($text, 0, $limit, 'UTF-8')。同时确认 mbstring 已加载、输入确实是 UTF-8,并把省略号是否占长度的规则先定下来。

先分清 substr、strlen 与 mb_substr

UTF-8 的一个中文字符通常由多个字节组成。substr()strlen() 面向字节工作,长度为 5 并不等于“前 5 个中文字符”;截在中间时,输出可能出现替换字符。PHP 手册把 mb_substr() 定义为按字符数执行的多字节安全截取,起始位置从 0 计数。

这里的关键不是把数字从 5 改大,而是换成字符语义的函数。存储层仍然要保证连接、表和页面的编码一致,否则输入在截取前就已经不是预期文本。

substr 的字节边界与 mb_substr 的字符边界关系图
字节长度和字符长度是两套计数边界,mb_substr 在字符边界上工作。

显式指定 UTF-8 截取中文

最小可复用写法如下。第四个参数不要省略:省略时 PHP 会使用 mbstring 的内部编码,部署环境如果配置不同,同一段代码可能得到不同结果。

这个函数把“正文最多几个字符”和“是否额外显示省略号”分开了。若产品要求总长度包括省略号,可以先把上限减 1,再截取正文;不要把多字节字符串交给 substr() 做补救。

检查 mbstring 扩展和内部编码

如果出现 Call to undefined function mb_substr(),先安装或启用 mbstring,不是修改参数名。函数可用后,仍建议在项目入口确认内部编码,尤其是 CLI、FPM 和队列消费者由不同配置启动时。

mb_internal_encoding() 是默认值的读写接口,但它不会自动把任意来源的数据转换成 UTF-8。文件、HTTP 请求或旧接口的编码不确定时,先完成明确的转码和校验,再做截取。

处理长度、后缀与边界

接口摘要最容易漏掉三个边界:空字符串、限制值小于等于 0,以及文本刚好等于限制值。前面的函数在这三处都给出了稳定返回值。还要提前决定 emoji、组合字符和展示宽度是否属于本题范围;mb_substr() 解决的是多字节字符计数,不等于完整的用户感知字素切分或终端显示宽度计算。

如果只想从末尾去掉固定字符,可以使用负的 startlength,但这会改变问题语义。普通列表摘要从开头保留内容时,正数 start=0 更容易读,也更便于测试。

PHP 文本处理中的输入编码、字符长度和展示后缀关系图
输入编码、字符计数与省略号策略属于不同边界,分别处理才能避免长度误判。

用字符数而不是字节数验收

不需要运行复杂项目,准备纯中文、英文加中文、空字符串和刚好达到上限的样例即可。验收关注两件事:结果没有乱码,字符数符合业务约定。

如果测试结果仍然异常,排查顺序应是:输入编码、mbstring 是否启用、调用处是否显式传入编码、最后才看业务的后缀规则。这样能把“半个字符”和“长度定义不一致”分开处理。

几个容易混淆的问题

为什么 mb_substr 还是显示乱码? 它只能保证按字符边界截取,不能修复已经损坏或不是 UTF-8 的输入。

能不能全局设置一次内部编码? 可以设置,但跨 CLI、FPM、队列和测试环境时不够稳;关键调用显式传 UTF-8 更清楚。

strlen 什么时候仍然有用? 计算协议、文件或二进制数据的字节数时仍应使用它;展示文本长度才使用 mb_strlen

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go os.Stat 判断文件存在时为什么不能忽略所有错误Go os.Stat 判断文件存在时为什么不能忽略所有错误
上一篇
Go os.Stat 判断文件存在时为什么不能忽略所有错误
Go log/slog 怎么给每条日志附加请求属性
下一篇
Go log/slog 怎么给每条日志附加请求属性
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    31次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    187次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    121次使用
  • AI Prompt Library:免费AI提示词库,助力ChatGPT高效创作与营销
    AI Prompt Library
    探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
    46次使用
  • Generrated:DALL·E 2/3 AI绘画提示词灵感库与图像对比平台
    Generrated
    Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
    30次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码