讲师中心 微信公众号
AI工具推荐 视频效率加速

c++怎么在读取文件时自动跳过所有UTF-8编码的非法字符【实战】

阿枫大大_2850

阿枫大大_2850

发布时间:2026-04-01 20:25:23

|

581人浏览过

|

来源于php中文网

原创

UTF-8非法字节序列导致std::invalid_argument或乱码,应使用std::vector以char流方式读取并手动跳过非法序列,而非直接用std::string接收后解析。

c++怎么在读取文件时自动跳过所有utf-8编码的非法字符【实战】

读取文件时遇到 std::invalid_argument 或乱码,大概率是 UTF-8 非法字节序列

标准 C++ 的 std::ifstream 本身不校验 UTF-8 合法性,它只是按字节读;一旦你用 std::string 接收后直接交给 std::u8string、std::from_chars、或某些 JSON 库(如 nlohmann/json),就可能在解析阶段抛出 std::invalid_argument —— 原因不是文件“读错了”,而是后续处理时发现某段字节不符合 UTF-8 编码规则(比如 0xF5 0x00 0x00 0x00 这种超范围的四字节起始)。

用 std::vector<char></char> 原始读取 + 手动跳过非法 UTF-8 字节序列

最可控的方式是绕过所有宽字符/编码感知接口,全程以 char 流处理,只在需要字符串语义时做“宽容解码”。关键逻辑:遍历每个字节,识别 UTF-8 起始字节(0xC0–0xFD),检查其后跟随字节数是否足够、是否均为 0x80–0xBF。不满足就跳过该字节(或整个疑似序列)。

实操建议:

  • 不要用 std::getline 直接读到 std::string 再处理——这样非法字节已混入,再切分成本高
  • 用 std::ifstream::read() 读到 std::vector<char></char>,然后用游标遍历
  • 对每个位置,用 (c & 0xC0) == 0xC0 判断是否为多字节起始;再根据前缀位数(2~4)检查后续字节有效性
  • 若检测到非法序列(如 0xC0 0x00),只跳过首字节(0xC0),而不是整段——避免误吞合法 ASCII

示例片段(跳过非法字节,保留其余):

立即学习“C++免费学习笔记(深入)”;

C++ 算法竞赛自动化测试数据生成与校验框架
C++ 算法竞赛自动化测试数据生成与校验框架

根据原题生成新题面、验证器及完整测试数据,自动套用 testlib 模板,用于用户要求生成测试数据时。

下载
std::vector<char> buf(4096);
in.read(buf.data(), buf.size());
size_t i = 0;
while (i < static_cast<size_t>(in.gcount())) {
    unsigned char c = buf[i];
    if (c < 0x80) { // ASCII
        out.push_back(c);
        ++i;
    } else if ((c & 0xE0) == 0xC0 && i + 1 < in.gcount() && (buf[i+1] & 0xC0) == 0x80) {
        out.push_back(c); out.push_back(buf[i+1]); i += 2; // 2-byte OK
    } else if ((c & 0xF0) == 0xE0 && i + 2 < in.gcount() &&
               (buf[i+1] & 0xC0) == 0x80 && (buf[i+2] & 0xC0) == 0x80) {
        out.push_back(c); out.push_back(buf[i+1]); out.push_back(buf[i+2]); i += 3;
    } else if ((c & 0xF8) == 0xF0 && i + 3 < in.gcount() &&
               (buf[i+1] & 0xC0) == 0x80 && (buf[i+2] & 0xC0) == 0x80 && (buf[i+3] & 0xC0) == 0x80) {
        out.push_back(c); out.push_back(buf[i+1]); out.push_back(buf[i+2]); out.push_back(buf[i+3]); i += 4;
    } else {
        ++i; // 跳过这个非法字节
    }
}

用 ICU 或 utf8cpp 做严格但易用的过滤(推荐用于生产)

手写 UTF-8 校验容易漏边界(比如超长编码、代理对、空终止符干扰)。更稳妥的做法是引入轻量库:

  • utf8cpp(header-only)提供 utf8::is_valid() 和 utf8::find_invalid(),可定位首个非法位置,再用 std::copy 分段拷贝合法区
  • ICU 的 u_strFromUTF8() 配合 U_BUFFER_OVERFLOW_ERROR 和 U_INVALID_CHAR_FOUND 可精确控制替换策略(如替换成 U+FFFD)
  • 注意:别用 std::codecvt_utf8 —— 它在 C++17 已被弃用,且多数标准库实现不处理非法输入,直接抛异常

用 utf8cpp 的典型流程:

std::string raw = read_whole_file(); // 全部读入 string
std::string clean;
utf8::replace_invalid(raw.begin(), raw.end(), std::back_inserter(clean));
// clean 现在不含非法 UTF-8 序列,非法字节被替换为 U+FFFD(即 "\xEF\xBF\xBD")

Windows 上用 std::wifstream 会更麻烦,别走这条路

有人想用 std::wifstream + std::locale 绕过问题,结果发现:

  • Windows 默认窄流用 ANSI 代码页(如 GBK),根本不是 UTF-8 —— 即使文件是 UTF-8,也会错解
  • 显式调用 imbue(std::locale(std::locale(), new std::codecvt_utf8<wchar_t>))</wchar_t> 在 MSVC 上常触发未定义行为或崩溃
  • _setmode(_fileno(stdin), _O_U16TEXT) 类接口只影响控制台,对文件流无效

结论:在 Windows 上也坚持用 std::ifstream + std::vector<char></char> + UTF-8 过滤,跨平台一致性更高。

真正容易被忽略的是 BOM 处理——UTF-8 BOM(0xEF 0xBB 0xBF)本身合法,但某些 parser 会把它当内容;跳过非法字节时得先判断并剥离 BOM,否则可能把 BOM 当作普通文本传给下游。

相关文章

c++速学教程(入门到精通)
c++速学教程(入门到精通)

c++怎么学习?c++怎么入门?c++在哪学?c++怎么学才快?不用担心,这里为大家提供了c++速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

c++

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

相关专题

更多
json数据格式
json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章,帮助大家解决问题。

1975

2023.08.07

json是什么
json是什么

JSON是一种轻量级的数据交换格式,具有简洁、易读、跨平台和语言的特点,JSON数据是通过键值对的方式进行组织,其中键是字符串,值可以是字符串、数值、布尔值、数组、对象或者null,在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容,供大家免费下载体验。

2682

2023.08.23

jquery怎么操作json
jquery怎么操作json

操作的方法有:1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”;3、“$.each(obj, callback)”;4、“$.ajax()”。更多jquery怎么操作json的详细内容,可以访问本专题下面的文章。

936

2023.10.13

go语言处理json数据方法
go语言处理json数据方法

本专题整合了go语言中处理json数据方法,阅读专题下面的文章了解更多详细内容。

2999

2025.09.10

string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

5239

2023.08.02

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

1558

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

2244

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

5764

2023.10.24

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

60

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn