fopen和fscanf读CSV易崩,因fscanf不识别CSV转义规则,无法正确处理逗号、换行及引号包裹字段(如"Smith, Jr."),导致解析错位、越界或漏读。

用 fopen 和 fscanf 读 CSV 容易崩,为什么?
因为 CSV 不是结构化二进制格式,fscanf 遇到逗号、换行、引号包裹的字段(比如 "Smith, Jr.")会直接错位解析。它按格式字符串硬切,不识别 CSV 的转义规则,一行里多个逗号就直接越界读或跳过字段。
常见错误现象:fscanf(fp, "%[^,],%[^,]", a, b) 在遇到空字段、含逗号的字符串、末尾换行符时崩溃或漏读;feof 被误用导致最后一行重复处理。
- 真正安全的做法:逐行读入(用
fgets),再手动拆分字段 - 必须自己处理双引号包围的字段——遇到开头
"就启用“引号模式”,跳过内部逗号,直到下一个未转义的" - Windows 换行
\r\n和 Unix\n都要兼容,别假设只有\n
写 CSV 时用 fprintf 直接拼接,哪些字符必须转义?
只有一类字符强制要求处理:字段内容本身含逗号、换行符或双引号。其他字符(如中文、空格、数字)无需特殊处理;但只要出现这三者之一,整个字段就必须用双引号包裹,且内部的双引号要变成两个双引号(CSV 标准转义)。
例如原始字符串 He said "Hi" → 写成 "He said ""Hi""";含换行的字段必须包引号,否则解析器会认为那是新行。
立即学习“C语言免费学习笔记(深入)”;
- 不要对所有字段无脑加引号——增加体积,也影响可读性
- 判断是否需包裹:扫描字段中是否存在
,、"或\n(包括\r\n) - 写引号内双引号时,用
strchr找位置 +memmove插入第二个",别用sprintf循环拼接(易缓冲区溢出)
fgets 读 CSV 行,缓冲区大小设多少才不截断?
没有“绝对安全”的固定值。CSV 单行长度完全由业务决定,可能几字节,也可能几 MB(比如日志里嵌了 base64 字段)。硬写 char buf[1024] 是最常见翻车点——截断后下一行解析全乱。
实际做法只有两种:要么用 POSIX getline(GNU/Linux/macOS 原生支持),要么自己实现动态增长读取(realloc + fgetc)。
-
getline返回实际长度,自动扩容,但 Windows 默认不带,需额外编译支持(如 MinGW) - 手写动态读需检查每次
fgetc是否为\n或EOF,并确保末尾有\0,别忘了realloc失败时清理内存 - 别信“CSV 行不会超 256 字符”这种经验——真实数据永远打脸
中文字段在 CSV 里显示乱码,是编码问题还是函数锅?
和 C 标准库函数无关。fgets、fputs 等只管字节流,不解释编码。乱码纯属文件保存编码(如 UTF-8)和打开软件默认编码(如 Excel 用 GBK)不匹配。
唯一能做的:写文件时,在开头加 UTF-8 BOM(\xEF\xBB\xBF),部分 Windows 软件(如旧版 Excel)靠它识别 UTF-8;但注意 BOM 不是 CSV 标准一部分,某些解析器会把它当脏数据。
- 加 BOM 只需在
fopen(..., "wb")后立刻fwrite("\xEF\xBB\xBF", 1, 3, fp) - 别试图在 C 里做 UTF-8 解码/验证——CSV 是文本协议,不是字符协议
- 如果目标是 Excel,且数据含中文,优先导出为
.xlsx(用 libxlsxwriter)比死磕 CSV 更省事

















