用csv.DictWriter流式写入字典列表可避免内存爆炸,内存仅占单行大小,速度提升3–5倍;需显式指定fieldnames、newline=''和encoding='utf-8',并合理设置缓冲与flush策略。

用 csv.DictWriter 一次写入,别用 pandas.DataFrame.to_csv() 处理千万级字典列表
内存爆炸和速度慢,基本都源于把整个字典列表先转成 DataFrame。千万级数据下,pandas 会复制数据、推断类型、构建索引,开销远超纯 CSV 写入本身。直接用标准库 csv.DictWriter 流式写入,内存只占用单行字典大小,速度提升 3–5 倍是常态。
-
DictWriter要求所有字典有相同 key 集合;如果字段不齐,提前补None或空字符串,否则会报ValueError: dict contains fields not in fieldnames - 务必显式指定
newline=''给open(),否则 Windows 下每行多一个空行 - 用
writeheader()仅需调一次,不要在循环里重复调 - 若字段含换行符、逗号或双引号,
csv模块默认用双引号包裹并转义,无需手动处理
字段顺序错乱?必须用 fieldnames 显式声明,别依赖字典插入顺序
Python 3.7+ 虽保证字典有序,但 DictWriter 不自动读取首条字典的 key 顺序——它只按你传入的 fieldnames 列表顺序写列。如果漏传或顺序不对,CSV 表头和数据列就错位,且不易察觉。
- 安全做法:从第一个字典取 key,转成
list并固定顺序:fieldnames = list(data[0].keys()) - 若字段有业务含义(如
'user_id'必须在前),别依赖原始字典顺序,显式构造fieldnames = ['user_id', 'name', 'created_at'] - 遇到某些字典缺字段,
DictWriter默认写空字符串;如需写NULL或其他占位符,初始化时加参数restval='NULL'
写入速度上不去?关掉缓冲、禁用 newline、批量 flush
默认文件写入带缓冲,小数据看不出问题,但百万级以上记录容易卡在缓冲区没刷出,看起来“卡住”或进程假死。同时频繁 flush() 又太重,得平衡。
- 打开文件时加
buffering=8192(或更大,如65536),避免系统频繁调度小块 I/O - 绝对不要在每行后调
file.flush();改用累计一定行数后 flush,比如每 10000 行:if i % 10000 == 0: csvfile.flush() - 确认输出路径所在磁盘不是高延迟设备(如网络挂载盘、老旧机械硬盘),本地 SSD 是基础保障
- 如果字段含大量 Unicode(如中文、emoji),用
encoding='utf-8-sig'避免 Excel 打开乱码,但注意这会多写 3 字节 BOM,不影响解析
遇到 UnicodeEncodeError: 'charmap' codec can't encode character 怎么办
这是 Windows 默认控制台/记事本编码(cp1252)打不开 UTF-8 文件的典型报错,不是数据问题,是文件打开方式错了。
立即学习“Python免费学习笔记(深入)”;
- 必须显式指定
encoding='utf-8'(Linux/macOS 可省略,但跨平台务必加上) - 别用
open(filename, 'w')这种裸写法;正确写法:open(filename, 'w', newline='', encoding='utf-8') - 如果下游必须用 Excel 打开且显示正常,用
encoding='utf-8-sig',它会在文件开头加 BOM,Excel 才能自动识别 UTF-8 - 检查字典值里有没有控制字符(如
\x00),CSV 规范不支持,写入前用value.replace('\x00', '')清洗
DictWriter、写 header、循环 writerow()。真正卡点不在语法,而在字段一致性、编码设定、缓冲策略这三处——漏一个,大规模写入就可能失败或结果异常。


















