PHP 8.0 字符串截断乱码主因是混淆字节与字符,应优先用 mb_substr() 替代 substr(),按 Unicode 字符而非字节操作,并配合 mb_strlen() 和 mb_internal_encoding('UTF-8') 确保 UTF-8 正确处理。

PHP 8.0 中字符串截断出问题,核心原因不是函数写错了,而是没分清「字节」和「字符」——substr() 按字节切,mb_substr() 按字符切。中文、emoji、日文等 UTF-8 多字节字符一旦用 substr() 截,很容易卡在中间字节,输出乱码或长度错乱。
优先用 mb_substr() 替代 substr()
PHP 8.0 默认启用 mbstring 扩展,直接换函数就能解决 90% 的乱码截断问题:
- 写法:`mb_substr($str, $start, $length, 'UTF-8')`
- 起始位置和长度都按「Unicode 字符个数」算,不是字节数
- 比如 `"Hello世界123"`,`mb_substr($str, 0, 5, 'UTF-8')` → `"Hello世"`(前 5 个字符)
- 第三个参数可为 `null` 表示取到末尾,比留空更清晰安全
截之前先用 mb_strlen() 判断真实长度
别再用 `strlen()` 做长度校验——它对 `"你好"` 返回 6(字节),而你实际要限制的是 2 个字符:
- 统一改用 `mb_strlen($str, 'UTF-8')` 获取字符数
- 配合 `mb_internal_encoding('UTF-8')` 确保 mb_* 函数默认编码正确
- 数据库字段设了 VARCHAR(255),但用户输了个 ?+??+文字共 255 个字符,`mb_strlen()` 返回 255 就合法;`strlen()` 却可能返回 260+,误判超长
需要按显示宽度截?用 mb_strimwidth()
适用于前端展示场景,比如摘要、卡片标题,要求「英文占 1 单位、中文/emoji 占 2 单位」的视觉等宽截断:
立即学习“PHP免费学习笔记(深入)”;
- 语法:`mb_strimwidth($str, $start, $width, $trim_marker, 'UTF-8')`
- `$width = 20` 表示最多显示 20 个「显示单位」,自动把 `"abc你好"` 算作 3 + 2×2 = 7 单位
- 支持加省略号:`mb_strimwidth($str, 0, 30, '…', 'UTF-8')`
特殊情况:必须用字节截?选 mb_strcut()
极少数场景需严格按字节控制(如协议解析、文件头处理),又不能破坏多字节字符,就别用 substr():
- `mb_strcut($str, $start, $length, 'UTF-8')` 按字节定位,但会自动对齐到字符边界,不拆开一个汉字
- 比如 `$str = "a你b"`(字节序列:a[1] + 你[3] + b[1]),`mb_strcut($str, 1, 3)` 不会取“你”的前两个字节,而是完整取“你”或跳过
- 它和 substr() 行为不同:前者安全,后者可能输出 ``



















