全角标点的Unicode范围包括U+3000–U+303F、U+3099–U+309C、U+30A0、U+30FB、U+FF01–U+FF5E、U+FFE0–U+FFE6等区间,需先将UTF-8字符串解码为char32_t码点再逐个判断。

全角标点的 Unicode 范围怎么判断
全角标点不是靠“宽度”识别的,而是落在特定 Unicode 区段:最常见的是 U+FF01–U+FF5E(全角 ASCII 对应区,如!"#$%…),加上 U+3000–U+303F(中文标点、顿号、书名号、句号等),以及 U+3099–U+309C、U+30A0、U+30FB 等零散字符。C++ 标准库不提供“是否为全角标点”的内置判定,必须手动检查码点。
关键点是:std::string 存的是字节,而全角字符在 UTF-8 下占 3 字节,不能用 char 遍历;必须先转成 std::u32string 或逐 UTF-8 解码。
用 std::u32string + 手动范围过滤最稳妥
把原始 UTF-8 字符串解码为 std::u32string,再对每个 char32_t 判断是否落在全角标点区间,保留非标点字符。这是最清晰、无编码歧义的做法。
实操建议:
立即学习“C++免费学习笔记(深入)”;
组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。
- 用
std::wstring_convert<std::codecvt_utf8<char32_t>, char32_t>(C++11/14)或 C++20 的std::from_chars+ 第三方 UTF-8 解码(如 utf8cpp)转码;更推荐直接用utf8cpp库避免过时 API - 判断逻辑用多个区间检查,别写成大段
if (c == 0x3002 || c == 0xFF01 || ...)——易漏且难维护 - 常见全角标点区间包括:
0x3000–0x303F、0x3099–0x309C、0x30A0、0x30FB、0xFF01–0xFF5E、0xFFE0–0xFFE6
示例片段(依赖 utf8cpp):
#include <utf8.h>
#include <string>
#include <vector>
std::string remove_fullwidth_punct(const std::string& s) {
std::u32string u32;
utf8::utf8to32(s.begin(), s.end(), std::back_inserter(u32));
std::u32string filtered;
for (char32_t c : u32) {
if (!((c >= 0x3000 && c <= 0x303F) ||
(c >= 0x3099 && c <= 0x309C) ||
(c == 0x30A0 || c == 0x30FB) ||
(c >= 0xFF01 && c <= 0xFF5E) ||
(c >= 0xFFE0 && c <= 0xFFE6))) {
filtered.push_back(c);
}
}
std::string out;
utf8::utf32to8(filtered.begin(), filtered.end(), std::back_inserter(out));
return out;
}
为什么不能用 iswpunct() 或 locale
std::iswpunct 依赖当前 locale,而多数系统 locale(如 "C" 或 "en_US.UTF-8")只识别 ASCII 标点,对 U+3002(。)、U+FF01(!)等返回 false,结果就是全角标点全被放过。
即使设成 setlocale(LC_CTYPE, "zh_CN.UTF-8"),行为也不可靠:glibc 对全角标点的 iswpunct 支持不一致,macOS 和 Windows 更弱。这不是 bug,是标准没规定全角字符必须被识别为标点。
所以:别指望标准宽字符分类函数,自己控范围才是唯一可移植方案。
性能和边界情况要注意什么
UTF-8 解码本身有开销,但对普通文本(
- 输入含非法 UTF-8 字节序列(如截断的 3 字节字符)——
utf8cpp默认抛异常,需用utf8::invalid_utf8捕获或改用容错解码 - 全角空格(U+3000)常被当成“空白”忽略,但它属于全角标点区,要删就得明确包含在过滤范围内
- 全角数字/字母(如 A、1)不属于标点,上述区间判断不会误删——这点正是手动范围的优势
如果字符串确定只含 GBK 或 Big5 编码,就不能用 UTF-8 解码路径,得先转 UTF-8 再处理;否则所有判断都失效。

















