PHP中文排序乱码根源是编码不一致,strcmp等函数按字节比较,UTF-8中文占3字节、GB2312占2字节;须统一源字符串、运行环境、collation编码,并用Collator类(locale设为zh_CN)配合usort实现语义级排序。

PHP中文排序乱码的根源是编码不一致
中文排序乱码不是“排错了”,而是 PHP 默认按字节比较(strcmp、sort 等函数),而 UTF-8 中文字符占 3 字节,GB2312 占 2 字节——一旦源字符串编码、运行环境内部编码、排序依据的 collation 不统一,结果就不可预测。最常见的情况是:数据库查出的 UTF-8 字符串,被当成 Latin-1 处理后排序,或 usort 用 strcmp 直接比,结果“张三”排在“李四”前面。
用 collator_compare 做真正语义级中文排序
PHP 自带的 Collator 类专为多语言本地化排序设计,支持 Unicode Collation Algorithm(UCA),能正确处理汉字笔画、拼音、部首顺序。它不依赖字符串字节值,而是基于 ICU 库的规则。
- 必须确保 PHP 编译时启用了
intl扩展(检查phpinfo()是否有 “intl” 模块) - 中文推荐使用 locale
zh_CN或zh_Hans_CN,而非zh(后者可能 fallback 到 C locale) - 不能直接传给
sort(),需配合usort()使用
$data = ['北京', '上海', '广州', '深圳'];
$collator = new Collator('zh_CN');
usort($data, [$collator, 'compare']);
// 结果:['北京', '广州', '上海', '深圳'](按拼音首字母 B-G-S-S)
MySQL 查询内排序更可靠,但要注意连接层
如果数据来自 MySQL,优先把排序逻辑下推到 SQL 层,避免 PHP 再次转换编码。但关键陷阱在于:即使表字段是 utf8mb4_unicode_ci,PHP 连接未声明 charset,返回的字符串仍可能被当错编码处理。
- 连接后必须立刻执行
$mysqli->set_charset('utf8mb4')(注意是utf8mb4,不是utf8) - SQL 中显式指定 collation,例如:
ORDER BY name COLLATE utf8mb4_unicode_ci - 避免用
ORDER BY CONVERT(name USING gbk)这类强制转码,易引入二次乱码
纯 PHP 排序时,mb_strtolower + strcoll 是备选方案
若无法启用 intl 扩展,可用 strcoll()(依赖系统 locale),但必须配合 setlocale(LC_COLLATE, 'zh_CN.UTF-8'),且该 locale 必须在服务器系统中真实存在(Linux 可用 locale -a | grep zh_CN 查看)。
立即学习“PHP免费学习笔记(深入)”;
-
strcoll()对大小写敏感,中文虽无大小写,但混合英文时需先统一转小写:mb_strtolower($s, 'UTF-8') - Windows 下
zh_CN.UTF-8常不可用,得换用Chinese_China.936(GBK),此时整个流程必须锁定 GBK 编码,否则崩 - 不推荐用于生产环境——系统 locale 不可控,Docker 镜像里常缺失,CI/CD 极易失败
真正麻烦的不是选哪个函数,而是从数据库连接、PHP 文件保存编码、HTTP 输出 header、到排序时的 locale 设置,这整条链路上只要有一环是 GBK 或 ISO-8859-1,Collator 也会返回错误顺序。别只盯着排序函数,先用 mb_detect_encoding() 和 bin2hex() 抽样检查实际字符串字节流。



















