用PHP将Unicode 转化为UTF-8-php教程-PHP中文网

首页

后端开发

php教程

用PHP将Unicode 转化为UTF-8

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Aug 08, 2016 am 09:25 AM

iconv name substr unicode

function unescape($str) { $str = rawurldecode($str);

<code> preg_match_all(<span>"/(?:<span>%u</span>.{4})|.{4};|\d+;|.+/U"</span>,<span>$str</span>,<span>$r</span>); <span>$ar</span> = <span>$r</span>[<span>0</span>]; <span>//print</span>_r(<span>$ar</span>); <span>foreach</span>(<span>$ar</span> as <span>$k</span>=><span>$v</span>) { <span>if</span>(<span>substr</span>(<span>$v</span>,<span>0</span>,<span>2</span>) == <span>"<span>%u</span>"</span>){ <span>$ar</span>[<span>$k</span>] = iconv(<span>"UCS-2BE"</span>,<span>"UTF-8"</span>,<span>pack</span>(<span>"H4"</span>,<span>substr</span>(<span>$v</span>,-<span>4</span>)));
  }
        elseif(<span>substr</span>(<span>$v</span>,<span>0</span>,<span>3</span>) == <span>""</span>){ <span>$ar</span>[<span>$k</span>] = iconv(<span>"UCS-2BE"</span>,<span>"UTF-8"</span>,<span>pack</span>(<span>"H4"</span>,<span>substr</span>(<span>$v</span>,<span>3</span>,-<span>1</span>)));
  }
        elseif(<span>substr</span>(<span>$v</span>,<span>0</span>,<span>2</span>) == <span>""</span>) { <span>$ar</span>[<span>$k</span>] = iconv(<span>"UCS-2BE"</span>,<span>"UTF-8"</span>,<span>pack</span>(<span>"n"</span>,<span>substr</span>(<span>$v</span>,<span>2</span>,-<span>1</span>)));
        }
    } <span>return</span><span>join</span>(<span>""</span>,<span>$ar</span>);
}
echo unescape(<span>"紫星蓝"</span>);</code>

登录后复制

今天有用户反馈，表单系统用户提交的数据中文会乱码。测试发现问题出在 iconv 转换上。
iconv(‘UCS-2’, ‘GBK’, ‘中文’)
Google 搜索发现，原因是 Linux 服务器上 UCS-2 编码方式与 Winodws 不一致。
于是，我改成 iconv(‘UCS-2BE’, ‘GBK’, ‘中文’) 试试，中文正常了

以下是有关两个平台 UCS-2 编码的潜规则：

1, UCS-2 不等于 UTF-16。 UTF-16 每个字节使用 ASCII 字符范围编码，而 UCS-2 对每个字节的编码可以超出 ASCII 字符范围。UCS-2 和 UTF-16 对每个字符至多占两个字节，但是他们的编码是不一样的。

2, 对于 UCS-2, windows 下默认是 UCS-2LE。用 MultibyteToWidechar（或者A2W）生成的是 UCS-2LE 的 unicode。windows记事本可以将文本保存为 UCS-2BE，相当于多了层转换。

3, 对于 UCS-2, linux 下默认是 UCS-2BE。用iconv(指定UCS-2)来转换生成的是 UCS-2BE 的 unicode。如果转换windows平台过来的 UCS-2, 需要指定 UCS-2LE。

4, 鉴于windows和linux等多个平台对 UCS-2 的理解不同（UCS-2LE,UCS-2BE）。MS 主张 unicode 有个引导标志(UCS-2LE FFFE, UCS-2BE FEFF)，以表明下面的字符是 unicode 并且判别 big-endian 或 little-endian。所以从 windows 平台过来的数据发现有这个前缀，不用慌张。

5, linux 的编码输出，比如从文件输出，从 printf 输出，需要控制台做适当的编码匹配（如果编码不匹配，一般和该程序编译时的编码有若干关系），而控制台的转换输入需要查看当前的系统编码。比如控制台当前的编码是 UTF-8, 那么 UTF-8 编码的东西能正确显示，GBK 就不能；同样，当前编码是 GBK, 就能显示 GBK 编码，后来的系统应该更智能的处理好更多的转换了。不过通过 putty 等终端还是需要设置好终端的编码转换以解除乱码的烦恼。

PHP中对汉字进行UNICODE编码和解码的实现

<code><span>//将内容进行UNICODE编码</span><span><span>function</span><span>unicode_encode</span><span>(<span>$name</span>)</span> {</span><span>$name</span> = iconv(<span>'UTF-8'</span>, <span>'UCS-2'</span>, <span>$name</span>); <span>$len</span> = strlen(<span>$name</span>); <span>$str</span> = <span>''</span>; <span>for</span> (<span>$i</span> = <span>0</span>; <span>$i</span> $len - <span>1</span>; <span>$i</span> = <span>$i</span> + <span>2</span>)
    { <span>$c</span> = <span>$name</span>[<span>$i</span>]; <span>$c2</span> = <span>$name</span>[<span>$i</span> + <span>1</span>]; <span>if</span> (ord(<span>$c</span>) > <span>0</span>)
        { <span>// 两个字节的文字</span><span>$str</span> .= <span>'\u'</span>.base_convert(ord(<span>$c</span>), <span>10</span>, <span>16</span>).base_convert(ord(<span>$c2</span>), <span>10</span>, <span>16</span>);
        } <span>else</span> { <span>$str</span> .= <span>$c2</span>;
        }
    } <span>return</span><span>$str</span>;
} <span>$name</span> = <span>'MY,你大爷的'</span>; <span>$unicode_name</span>=unicode_encode(<span>$name</span>); <span>echo</span><span>'<h3 id="">'</h3></span>.<span>$unicode_name</span>.<span>''</span>; <span>// 将UNICODE编码后的内容进行解码</span><span><span>function</span><span>unicode_decode</span><span>(<span>$name</span>)</span> {</span><span>// 转换编码，将Unicode编码转换成可以浏览的utf-8编码</span><span>$pattern</span> = <span>'/([\w]+)|(\\\u([\w]{4}))/i'</span>;
    preg_match_all(<span>$pattern</span>, <span>$name</span>, <span>$matches</span>); <span>if</span> (!<span>empty</span>(<span>$matches</span>))
    { <span>$name</span> = <span>''</span>; <span>for</span> (<span>$j</span> = <span>0</span>; <span>$j</span> $matches[<span>0</span>]); <span>$j</span>++)
        { <span>$str</span> = <span>$matches</span>[<span>0</span>][<span>$j</span>]; <span>if</span> (strpos(<span>$str</span>, <span>'\\u'</span>) === <span>0</span>)
            { <span>$code</span> = base_convert(substr(<span>$str</span>, <span>2</span>, <span>2</span>), <span>16</span>, <span>10</span>); <span>$code2</span> = base_convert(substr(<span>$str</span>, <span>4</span>), <span>16</span>, <span>10</span>); <span>$c</span> = chr(<span>$code</span>).chr(<span>$code2</span>); <span>$c</span> = iconv(<span>'UCS-2'</span>, <span>'UTF-8'</span>, <span>$c</span>); <span>$name</span> .= <span>$c</span>;
            } <span>else</span> { <span>$name</span> .= <span>$str</span>;
            }
        }
    } <span>return</span><span>$name</span>;
} <span>echo</span><span>'MY,\u4f60\u5927\u7237\u7684 -> '</span>.unicode_decode(<span>$unicode_name</span>);</code>

登录后复制

以上就介绍了用PHP将Unicode 转化为UTF-8，包括了方面的内容，希望对PHP教程有兴趣的朋友有所帮助。

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸！

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

Java教程

1665

CakePHP 教程

1423

Laravel 教程

1321

PHP教程

1269

C# 教程

1249

显示更多

Related knowledge

中文处理必备函数推荐：PHP iconv函数详解 Jun 27, 2023 pm 02:04 PM

在进行文本处理过程中，对于不同编码格式的字符串进行转换是常见的需求。而PHP语言中提供的iconv（InternationalizationConvertion）函数可以非常方便地满足这一需求。本文将从以下几个方面详细介绍iconv函数的使用方法：iconv函数的定义和常见参数介绍实例演示：将GBK编码的字符串转换为UTF-8编码的字符串实例演示：将UTF

深入了解PHP：JSON Unicode转中文的实现方法 Mar 05, 2024 pm 02:48 PM

深入了解PHP：JSONUnicode转中文的实现方法在开发中，我们经常会遇到需要处理JSON数据的情况，而JSON中的Unicode编码在一些场景下会给我们带来一些问题，特别是当需要将Unicode编码转换为中文字符时。在PHP中，有一些方法可以帮助我们实现这个转换过程，下面将介绍一种常用的方法，并提供具体的代码示例。首先，让我们先了解一下JSON中Un

unicode怎么转中文 Dec 14, 2023 am 10:57 AM

Unicode是一种字符编码标准，用于表示各种语言和符号。要将Unicode编码转换为中文字符，可使用Python的内置函数chr()和ord()。

PHP返回字符串第一个字符的 ASCII 值 Mar 21, 2024 am 11:01 AM

这篇文章将为大家详细讲解有关PHP返回字符串第一个字符的ASCII值，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。PHP返回字符串第一个字符的ASCII值引言在php中，获取字符串第一个字符的ASCII值是一个常见的操作，涉及到字符串处理和字符编码基础知识。ASCII值用于表示字符在计算机系统中的数字值，对于字符比较、数据传输和存储至关重要。过程获取字符串第一个字符的ASCII值涉及以下步骤：获取字符串：确定要获取ASCII值的字符串。它可以是变量、字符串常量

PHP返回一个字符串在另一个字符串中开始位置到结束位置的字符串 Mar 21, 2024 am 10:31 AM

这篇文章将为大家详细讲解有关PHP返回一个字符串在另一个字符串中开始位置到结束位置的字符串，小编觉得挺实用的，因此分享给大家做个参考，希望大家阅读完这篇文章后可以有所收获。PHP中使用substr()函数从字符串中提取子字符串substr()函数可从字符串中提取指定范围内的字符。其语法如下：substr(string,start,length)其中：string：要从中提取子字符串的原始字符串。start：子字符串开始位置的索引（从0开始）。length（可选）：子字符串的长度。如果未指定，则提

解决Eclipse中文乱码问题的方法试试看 Jan 03, 2024 pm 05:28 PM

Eclipse中文乱码困扰？试试这些解决方案，需要具体代码示例一、背景介绍随着计算机技术的不断发展，中文在软件开发中扮演着越来越重要的角色。然而，很多开发者在使用Eclipse进行中文开发时会遇到乱码问题，影响了工作效率。那么，本文将介绍一些常见的乱码问题，并给出相应的解决方案及代码示例，帮助读者解决Eclipse中文乱码问题。二、常见乱码问题及解决方案文件

PHP教程：如何将JSON Unicode转换为中文字符 Mar 05, 2024 pm 06:36 PM

JSON（JavaScriptObjectNotation）是一种轻量级的数据交换格式，通常用于Web应用程序之间的数据交换。在处理JSON数据时，我们经常会遇到Unicode编码的中文字符（例如"u4e2du6587"），需要将其转换为可读的中文字符。在PHP中，我们可以通过一些简单的方法来实现这个转换。接下来，我们将详细介绍如何将JSONUnico