wordwrap对中文失效因按字节切分且仅识别ASCII分隔符,易截断UTF-8多字节序列;应使用mb_substr配合mb_strlen逐字符扫描,在完整汉字边界折行。

为什么 wordwrap 对中文失效
wordwrap 默认按字节切分,且只识别空格、制表符等 ASCII 分隔符。中文没有空格分隔,每个汉字占 3 字节(UTF-8),wordwrap 可能截断在 UTF-8 多字节序列中间,导致乱码或显示异常。它不理解“字符边界”,更不支持 Unicode 字符宽度判断。
用 mb_substr + 手动逐字符扫描实现安全折行
核心思路:不依赖空格,而是按指定最大宽度(字符数,非字节数)切分,并确保每次切割都在完整汉字边界上。需配合 mb_strlen 和 mb_substr 使用,且必须启用 mbstring 扩展并设置内部编码:
- 确认
mbstring已启用:extension=mbstring在php.ini中未被注释 - 开头调用
mb_internal_encoding('UTF-8'),避免函数默认用 ISO-8859-1 解析 - 逐字符累加长度,一旦超过阈值就插入换行符,不强行截断
示例逻辑(非完整函数,仅示意关键判断):
function safe_wordwrap_chinese($text, $width = 20) {
if (!mb_check_encoding($text, 'UTF-8')) {
$text = mb_convert_encoding($text, 'UTF-8', 'auto');
}
$result = '';
$current_line = '';
$len = mb_strlen($text, 'UTF-8');
for ($i = 0; $i < $len; $i++) {
$char = mb_substr($text, $i, 1, 'UTF-8');
if (mb_strlen($current_line . $char, 'UTF-8') <= $width) {
$current_line .= $char;
} else {
$result .= $current_line . "\n";
$current_line = $char;
}
}
return $result . $current_line;
}
用正则匹配 Unicode 字符块再分段(适合固定宽度排版)
若需更贴近排版习惯(如每行最多 20 个汉字,忽略标点宽度差异),可用 preg_split 按 Unicode 字符类切割,再组合:
立即学习“PHP免费学习笔记(深入)”;
将 LaTeX(.tex)学术论文转换为 Word(.docx),支持可编辑的 OMML 公式、原生 Word 表格、嵌入图形、IEEE 双栏排版及参考文献
preg_split('/(? 不可靠,因 <code>\X是图形单元,不等于字符- 更稳妥的是:先用
preg_match_all('/./u', $text, $matches)拆成字符数组,再用array_chunk分组,最后implode - 注意:全角标点(,。!?)和半角标点(,.!?)应统一视为 1 字符,该方式天然支持
简写示例:
$chars = preg_match_all('/./u', $text, $m) ? $m[0] : [$text];
$lines = array_map(fn($chunk) => implode('', $chunk), array_chunk($chars, 20));
$result = implode("\n", $lines);
直接使用 mb_strimwidth 截断 + 补充省略逻辑(仅限单行限制场景)
如果目标不是“自动折行”,而是“单行最多 N 字符 + 省略号”,mb_strimwidth 是最轻量且安全的选择:
- 参数顺序为
mb_strimwidth($str, $start, $width, $trimmarker, $encoding) - 它内部已做 UTF-8 边界保护,不会截断汉字
- 但注意:它只返回单行,不负责多行换行 —— 若需多行,仍得自己循环处理
例如:mb_strimwidth($text, 0, 40, '…', 'UTF-8') 安全截取前 40 个汉字并加省略号。
真正容易被忽略的点是:所有这些方案都依赖 mbstring 的正确配置,且不能假设输入文本一定合法 UTF-8 —— 生产环境务必先用 mb_check_encoding 校验,必要时用 mb_convert_encoding($text, 'UTF-8', 'auto') 尝试自动探测转码,否则后续一切字符计数都会错位。


















