讲师中心 微信公众号
AI工具推荐 视频效率加速

怎样用Python将清洗后的海量数据高效写入Parquet格式文件?

大明酱_6007

大明酱_6007

发布时间:2026-09-05 07:55:46

|

1039人浏览过

|

来源于php中文网

原创

pandas.to_parquet() 处理千万级数据易OOM或极慢,因默认将全量DataFrame加载内存;应改用pyarrow分块写入、设row_group_size、ZSTD压缩及use_dictionary控制,并注意时区、空值、文件命名问题。

怎样用python将清洗后的海量数据高效写入parquet格式文件?

用 pandas.to_parquet() 直接写入千万级数据大概率会 OOM 或极慢——核心问题不在 Parquet 本身,而在默认参数没适配大数据场景。

为什么 to_parquet() 默认行为在海量数据下失效

默认用 engine="pyarrow",但不显式控制分块、压缩和内存缓冲时,pandas 会把整个 DataFrame 加载进内存再序列化。遇到 500 万行以上、宽表(>100 列)或含长文本列的数据,很容易触发 MemoryError 或 GC 频繁卡死。

常见错误现象:MemoryError、进程被系统 kill、写入耗时从秒级飙升到小时级、生成的 Parquet 文件意外只有单个 row group(丧失查询剪枝能力)。

关键原因:未启用分块写入(chunked write)、未设 compression、未调优 use_dictionary 和 use_deprecated_int96_timestamps 等底层参数。

立即学习“Python免费学习笔记(深入)”;

用 pyarrow.parquet.write_table() 手动分块写入

绕过 pandas 的中间层,直接用 PyArrow 控制写入粒度。适合已清洗好、存在内存中但不宜全量加载的 DataFrame,或需流式处理的场景。

Shadows Python Sensei
Shadows Python Sensei

Python 最佳实践助手——代码规范、设计模式、性能优化、测试与类型注解。适用于编写或审查 Python 代码。

下载
  • 先用 pa.Table.from_pandas(df) 转换,但别一次性转全部——按行数切片,例如每 10 万行一批
  • 用 pa.parquet.write_table() 的 row_group_size 参数(如 row_group_size=100_000)强制分组,避免单 group 过大
  • 显式指定压缩:compression="ZSTD"(比默认 "SNAPPY" 压缩率高、解压快,PyArrow ≥ 8.0 支持)
  • 对字符串列关闭字典编码可省内存:use_dictionary=False(尤其当唯一值占比 >30% 时)

示例片段:

import pyarrow as pa
import pyarrow.parquet as pq
<h1>df 是你清洗后的 chunk(例如 df.iloc[0:100000])</h1><p>table = pa.Table.from_pandas(df)
pq.write_table(
table,
"output/part-001.parquet",
row_group_size=100_000,
compression="ZSTD",
use_dictionary={"text_col": False}  # 按列控制
)

用 Dask 处理超大 CSV/JSON 清洗后直接存 Parquet

如果原始数据根本装不下内存(比如 10GB+ CSV),pandas 先读再写是死路一条。Dask DataFrame 的 to_parquet() 天然支持分块、分区、并行写入,且不强制全量驻留内存。

  • 清洗操作(dropna、map、astype)要尽量用 Dask 原生方法,避免 .compute() 提前触发计算
  • 写入时设 partition_on=["date"] 可按列值自动建子目录,后续 Spark/Flink 查询能跳过无关分区
  • 必须指定 write_index=False(Dask 默认带 index,Parquet 不需要,且浪费空间)
  • 用 schema="infer" 或提前传 schema=pa.schema(...),避免每块推断 schema 带来的开销和类型不一致

注意:dask.dataframe.to_parquet() 底层仍调 PyArrow,但调度层帮你管了 chunk size、线程数(num_workers)和内存限制(memory_limit)。

容易被忽略的三个硬伤点

第一,时间列时区丢失:datetime64[ns] 列若含 tz-aware 数据,默认写入会转成 UTC 且丢时区信息。必须加 use_deprecated_int96_timestamps=False + 显式 timestamp_as_object=False,或提前用 dt.tz_localize(None)。

第二,空字符串和 NaN 混存:pandas 把空字符串 "" 和 np.nan 都映射为 Parquet 的 NULL,但读回时可能全变 None。清洗阶段统一转成 pd.NA 并设 dtype="string",写入时加 use_dictionary=True 保语义。

第三,文件名不带哈希或序号:直接写 "data.parquet" 会被覆盖。务必用 f"data-{i:04d}.parquet" 或依赖 Dask 自动命名,否则重跑任务时数据静默丢失。

热门AI工具

更多
切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1591

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3804

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1589

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

21937

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2687

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2747

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1103

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

80

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn