pandas.concat()是合并多个同结构CSV文件的首选方法,需确保列名、列序、dtype一致,关键参数包括ignore_index=True、显式dtype、parse_dates,并用glob获取路径、rename标准化列名、reindex统一列序。

用 pandas.concat() 合并多个 CSV 文件最直接
只要文件字段名、列顺序、数据类型基本一致,pandas.concat() 就是首选。它不依赖文件路径模式或元数据对齐,只按列名(或位置)堆叠,速度快、可控性强。
常见错误是直接用 pd.read_csv() 逐个读再手动拼接列表——这容易漏掉 ignore_index=True,导致合并后索引重复;或者忘了统一 dtype,造成某列在部分文件里是字符串、部分是数字,后续计算出错。
- 先用
glob.glob("data/*.csv")或pathlib.Path("data").glob("*.csv")获取所有路径,别手写列表 - 读取时显式传入关键参数:
dtype(尤其数值列含空值时设为"nullable"类型如Int64)、parse_dates(避免合并后日期变 object)、keep_default_na=False(防止空字符串被误转为NaN) - 合并时加
ignore_index=True重置行索引;若需保留原始文件来源,可在读取时用assign(filename=...)插入一列
列名不完全一致时,必须提前对齐
比如有的 CSV 是 "user_id",有的是 "uid",或大小写混用("Amount" vs "amount"),concat 默认按列名匹配,错位列会变成全 NaN,且不报错——这是最隐蔽的坑。
不要指望 keys 或 names 参数解决列名差异;它们只是加层级索引,不改列名本身。
立即学习“Python免费学习笔记(深入)”;
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- 读取单个文件后立刻用
.rename(columns={...})标准化列名,或统一用pd.read_csv(..., usecols=...)只读你确认存在的列 - 用
pd.read_csv(..., header=0).columns.tolist()检查每个文件的实际列名,找出差异项 - 如果列顺序也不一致(如 A 文件列序是
["a","b","c"],B 文件是["c","a","b"]),合并前务必调用.reindex(columns=standard_cols)
大文件合并卡顿或内存爆掉?换分块读取 + 追加写入
单个 CSV 超 500MB,或总文件数超 50 个时,一次性全读进内存大概率触发 MemoryError。这时硬扛 concat 不现实,得绕过内存瓶颈。
别用 to_csv(..., mode="a") 循环追加——默认不写表头,第二份开始就缺列名;而且没做类型对齐,后期读取仍可能报错。
- 先读第一个文件,获取标准
dtypes和列名,存成字典:schema = pd.read_csv(files[0], nrows=0).dtypes.to_dict() - 用
pd.read_csv(..., chunksize=N)分批读其余文件,每批用astype(schema)强制类型,再to_csv(..., mode="a", header=False if i>0 else True) - Linux/macOS 下可考虑
cat *.csv > merged.csv(前提:无表头且格式绝对一致),但 Windows 需用type *.csv > merged.csv,且必须确保所有文件编码、换行符统一
pd.merge() 不适合多文件纵向合并
新手常误用 merge,以为“合并”就是它。但 merge 是按键列横向关联(类似 SQL JOIN),不是纵向堆叠。拿两个 CSV 做 merge 再和第三个 merge,逻辑上是笛卡尔积风险,性能断崖下跌,结果也完全不是你想要的“拼起来”。
除非你明确要基于某列做关联(如把订单表和用户表按 user_id 合并),否则看到“多个 CSV 合成一个”,本能该想到 concat,而不是 merge、join 或 append(后者已弃用)。
真正容易被忽略的是:即使结构“看似相同”,也要检查空值表示方式(""、"NULL"、"N/A")、时间格式("2023-01-01" vs "01/01/2023")、数值千分位符号("1,234.5")。这些差异不会阻止 concat 执行,但会让后续分析失效。

















