Pandas处理大文件慢的根源是内存瓶颈、解析开销与非向量化操作;应禁用自动类型推断、使用合适格式(如xlsb/parquet)、指定dtype、流式读取、向量化计算并合理选型工具链。

因为Pandas默认把整个文件一次性加载进内存,而1GB以上数据很容易超出可用RAM,触发系统频繁换页(swap),I/O开销剧增——这不是“慢”,是内存瓶颈下的硬性卡顿。
read_csv/read_excel 会一次性解压+解析全部内容
特别是 .xlsx 文件:本质是ZIP包,pd.read_excel() 必须先解压所有XML节点,再逐行解析标签结构。测试显示,50MB的.xlsx中40%耗时在XML解析,25%在解压。而 .csv 虽无解压,但默认逐行推断类型(int64、object等),对千万行数据就是上百万次类型检查。
- 避免用
read_excel()处理超10万行Excel;改用openpyxl流式读取或转存为.xlsb(二进制格式,免解压) - 读CSV时务必加
dtype参数,禁用自动推断;大Excel也建议先用Excel另存为.csv再读 -
usecols能砍掉70%列就别留全量——少读一列,内存和解析时间都线性下降
内存爆炸源于默认数据类型太“豪横”
Pandas为保兼容,默认用 int64 存ID、float64 存价格、object 存城市名。1000万行的 int64 列占80MB,换成 int32 直接省一半;重复出现的城市名用 object 每个字符串单独存引用,改 category 后可能只占几MB。
- 查真实内存占用:运行
df.info(memory_usage='deep'),别信表面行数 - 加载时就约束类型:
dtype={'user_id': 'uint32', 'score': 'float32', 'region': 'category'} - 已有DataFrame可批量压缩:
df = df.convert_dtypes(dtype_backend='numpy_nullable')(pandas ≥2.0)
单线程 + Python层循环 = CPU永远只用1核
apply()、iterrows()、map() 这类操作本质是Python for 循环,每行都进解释器,1000万行≈1000万次函数调用开销。而 np.where()、布尔索引、groupby().transform() 是C层向量化,一次处理整列。
立即学习“Python免费学习笔记(深入)”;
- 别写
df['label'] = df.apply(lambda x: 'A' if x['val']>90 else 'B', axis=1),改用df['label'] = np.where(df['val']>90, 'A', 'B') -
groupby().apply()比groupby().agg()或.transform()慢5–10倍,除非真要返回非标量结果 - 真需要复杂逻辑?先用
query()或布尔索引筛出子集,再小范围apply,别硬刚全量
最易被忽略的一点:不是所有“大文件”都该用Pandas硬扛。1GB CSV用优化后Pandas能扛,但1GB嵌套JSON或带公式的Excel,优先考虑转Parquet + DuckDB,或者直接切分后用Dask调度——工具链选错,优化再细也白搭。


















