讲师中心 微信公众号
AI工具推荐 视频效率加速

C++如何去掉字符串中的所有双字节字符

阿涛小哥_5969

阿涛小哥_5969

发布时间:2026-08-22 14:41:28

|

705人浏览过

|

来源于php中文网

原创

正确答案是:不能简单用static_cast<unsigned char>(c) > 127判断中文等双字节字符,而应按UTF-8编码规则解析首字节(如0xE0–0xEF)并验证后续字节模式,或使用utf8cpp等成熟库安全迭代码点。

c++如何去掉字符串中的所有双字节字符

如何判断一个字符是双字节(如中文)而非 ASCII 字符

在 C++ 中,std::string 本质是 char 序列,而 UTF-8 编码下,ASCII 字符(U+0000–U+007F)占 1 字节,中文等常用汉字通常占 3 字节(如 \xe4\xb8\xad),部分扩展区字符甚至占 4 字节。不能简单用 static_cast<unsigned char>(c) > 127</unsigned> 判断——这只能识别单字节范围外的值,但会把 UTF-8 多字节序列中的中间字节(如 \xb8\xad)误判为“双字节字符”,导致删错或崩溃。

正确做法是:按 UTF-8 编码规则解析字节流,识别出完整码点。C++20 前无标准 UTF-8 解码 API,需手动验证首字节:

  • 首字节 0xxxxxxx → ASCII,1 字节
  • 首字节 110xxxxx → 后跟 1 个 10xxxxxx 字节,共 2 字节
  • 首字节 1110xxxx → 后跟 2 个 10xxxxxx 字节,共 3 字节
  • 首字节 11110xxx → 后跟 3 个 10xxxxxx 字节,共 4 字节
  • 其他值(如 10xxxxxx11111xxx)为非法 UTF-8,可视为损坏或非 UTF-8 数据

用 std::string 遍历 UTF-8 字符并过滤

不能用 for (char c : s)s[i] 按字节索引直接取“字符”,必须按码点边界移动索引。以下是一个安全跳过 UTF-8 多字节序列的过滤函数:

std::string remove_multibyte_chars(const std::string& s) {
    std::string result;
    result.reserve(s.size()); // 预分配避免频繁 realloc
    size_t i = 0;
    while (i < s.size()) {
        unsigned char b0 = s[i];
        // ASCII: 0xxxxxxx
        if ((b0 & 0x80) == 0) {
            result += s[i++];
        }
        // 2-byte: 110xxxxx → skip entire sequence
        else if ((b0 & 0xE0) == 0xC0 && i + 1 < s.size() &&
                 (static_cast<unsigned char>(s[i + 1]) & 0xC0) == 0x80) {
            i += 2;
        }
        // 3-byte: 1110xxxx → skip
        else if ((b0 & 0xF0) == 0xE0 && i + 2 < s.size() &&
                 (static_cast<unsigned char>(s[i + 1]) & 0xC0) == 0x80 &&
                 (static_cast<unsigned char>(s[i + 2]) & 0xC0) == 0x80) {
            i += 3;
        }
        // 4-byte: 11110xxx → skip
        else if ((b0 & 0xF8) == 0xF0 && i + 3 < s.size() &&
                 (static_cast<unsigned char>(s[i + 1]) & 0xC0) == 0x80 &&
                 (static_cast<unsigned char>(s[i + 2]) & 0xC0) == 0x80 &&
                 (static_cast<unsigned char>(s[i + 3]) & 0xC0) == 0x80) {
            i += 4;
        }
        // 非法 UTF-8 字节(如孤立 0x80–0xBF,或超长序列),保守处理:跳过单字节
        else {
            i++;
        }
    }
    return result;
}

该函数只保留 ASCII 码点(U+0000–U+007F),其余所有多字节 UTF-8 序列均被跳过。注意它不校验码点语义(比如不区分中文、日文、emoji),只要不是单字节就剔除。

立即学习C++免费学习笔记(深入)”;

如果输入不是 UTF-8,而是 GBK/Shift-JIS 等编码怎么办

上述逻辑**仅适用于 UTF-8 编码字符串**。若原始字符串是 GBK(如 Windows 简体中文系统默认),一个中文字符占 2 字节,且首字节范围是 0x81–0xFE,次字节是 0x40–0xFE(排除 0x7F)。此时用 UTF-8 规则解析会完全错误:可能把 GBK 的“双字节中文”拆成两个非法字节,或误吞 ASCII 字符。

C++
C++

"空空如也"

下载

解决方法只有两个:

  • 确保输入是 UTF-8 —— 这是最推荐的做法,统一编码能避免绝大多数问题
  • 若必须处理 GBK,需改写判断逻辑:if (b0 >= 0x81 && b0 = 0x40 && s[i + 1] != 0x7F),然后跳过 2 字节;但要注意 GBK 中也存在单字节 ASCII 和一些兼容区字节,不能只靠首字节高位判断

没有通用“去掉双字节字符”的银弹 —— 编码决定字节含义,脱离编码谈“双字节”没有意义。

为什么 std::wstring 或 C++20 std::u8string 并不简化这个问题

有人想用 std::wstring 存宽字符再遍历,但这是陷阱:wchar_t 在 Windows 是 UTF-16(2 或 4 字节),Linux/macOS 通常是 UTF-32(固定 4 字节),且 std::stringstd::wstring 的转换需要明确指定编码(如 std::wstring_convert 已弃用),极易出错。C++20 引入 std::u8string,但它只是 std::basic_string<char8_t> 的别名,底层仍是字节序列,不提供自动解码能力。

真正省事的方式是依赖成熟库:

  • utf8cpp(轻量头文件库):调用 utf8::is_valid(s.begin(), s.end())utf8::next() 安全迭代
  • 用 ICU 或 Boost.Locale 做健壮编码转换与过滤
  • 若项目已用 Qt,QString::toUtf8() + QRegularExpression 更直观

自己手写 UTF-8 解析容易漏掉边界情况(如超长编码、代理对、禁止码点),生产环境建议优先用测试过的库。

热门AI工具

更多
立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
c++和c语言的区别有哪些
c++和c语言的区别有哪些

c++和c语言的区别:1、面向对象编程(OOP)支持不同;2、新增特性不同;3、标准库不同;4、编译方式不同;5、命名空间不同等等。想了解更多c++的相关内容,可以阅读本专题下面的文章。

2068

2024.03.14

c++和python学习顺序推荐
c++和python学习顺序推荐

一般建议先学习C++,再学习Python,因为这样可以逐步从较为底层的编程语言向更高级的语言过渡。想了解更多python的相关内容,可以阅读本专题下面的文章。

959

2024.03.14

python和c++学习性价比分析
python和c++学习性价比分析

Python易于学习,广泛应用于Web开发、数据科学和人工智能等领域,但性能较低。C语言性能高,适用于对性能要求较高的场景,如游戏开发和系统编程,但学习曲线陡峭,错误处理复杂。想了解更多python的相关内容,可以阅读本专题下面的文章。

367

2024.03.14

c语言和c++一样吗
c语言和c++一样吗

c语言和c++是两种不同的编程语言,虽然有相似之处,但存在显著差异。c语言专注于过程式编程和系统级开发,以简洁、高效著称。c++作为c语言的超集,引入了面向对象编程,增强了代码组织和管理能力,但学习曲线也更陡峭。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

307

2024.03.14

c语言和c++先学哪个好
c语言和c++先学哪个好

初学者选择学习c语言还是c++语言,需要根据个人学习目标、背景以及编程兴趣和预期应用方向来决定。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

346

2024.03.14

c语言和c++的区别和联系
c语言和c++的区别和联系

c语言和c++是计算机科学领域应用广泛的编程语言。虽然它们有着相似的基础,但它们在语言类型、语法功能和内存管理方面存在着显著差异。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

560

2024.03.14

c++软件中文更改教程
c++软件中文更改教程

对于 ide,可通过打开设置,找到语言设置,选择中文,并保存更改。对于非 ide 应用程序,可查找设置或选项,选择语言设置,更改为中文,并保存更改。想了解更多c++的相关内容,可以阅读本专题下面的文章。

1389

2024.03.21

python和java和c++学习性价比分析
python和java和c++学习性价比分析

Python以其易学性、丰富的库和活跃的社区而著称,适合数据科学、人工智能和Web开发。Java以其跨平台性、企业级应用开发和Android应用开发而闻名。C++以其底层控制能力、高效性能和游戏开发而著称。选择哪种语言取决于个人兴趣、职业方向和特定需求。想了解更多python和java和c++的相关内容,可以阅读本专题下面的文章。

1177

2024.03.22

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn