优先用 engine='calamine' 读大 Excel,指定 usecols/nrows,避免读全表;比对用 pd.merge(..., how='outer', indicator=True);报告优先 to_html();预处理需统一类型、空格、缺失值。

用 pandas 读取大 Excel 文件时内存爆了怎么办?
直接用 pandas.read_excel() 读超大 Excel(比如 50MB+、10 万行以上)极易触发 MemoryError 或卡死,根本不是“慢”,是根本跑不起来。核心原因是 Excel 格式(尤其是 .xlsx)底层是 ZIP 压缩的 XML,openpyxl 引擎默认加载全量结构到内存。
实操建议:
- 优先用
engine='calamine'(需安装pip install calamine-python),它基于 Rust,流式解析,100MB 文件通常 2–5 秒内完成读取,内存占用不到openpyxl的 1/10 - 明确指定
usecols和nrows,只读真正要对比的列和前 N 行(比如先抽样验证逻辑) - 避免
read_excel(..., sheet_name=None)—— 它会把所有 sheet 都读进 dict,内存翻倍 - 如果必须用
openpyxl,加read_only=True,但依然不如calamine
逐行比对两份 DataFrame 时,merge 和 concat 哪个更稳?
别用 df1.compare(df2) —— 它要求索引完全一致且列名顺序相同,实际业务中几乎不可用;也别手写循环比对,10 万行 × 10 万行就是 100 亿次操作。
正确姿势是用 pd.merge() 做外连接(how='outer'),靠 _merge 标记来源:
立即学习“Python免费学习笔记(深入)”;
diff = pd.merge(df1, df2, on=['id'], how='outer', indicator=True, suffixes=('_old', '_new'))
关键点:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
-
on必须是稳定唯一键(如主键或业务 ID),不能用可能重复的字段(如姓名、日期) -
suffixes要设,否则同名列会变成col_x/col_y,难定位差异 - 生成的
_merge列值为both/left_only/right_only,直接过滤就能拿到新增、删除、变更行 - 对数值列做差异判断时,用
np.isclose(a, b)替代==,避免浮点误差误报
生成可读报告时,为什么 to_html() 比 Excel 导出更可靠?
用 df.to_excel() 写差异报告,常遇到:样式丢失、合并单元格错乱、中文乱码、文件打不开(尤其带百万级行时)。而 HTML 报告本质是纯文本渲染,无格式包袱,浏览器打开即见结果。
实操建议:
- 用
diff.to_html(table_id='diff-table', classes='table')输出基础表格 - 给差异行加背景色:先构造布尔掩码,再用
Styler.applymap(),例如高亮变更字段:def highlight_diff(val): return 'background-color: #fff3cd' if pd.notna(val) and 'old' in str(val).lower() else '' styled = diff.style.applymap(highlight_diff, subset=['amount_old', 'amount_new']) - 最终用
styled.to_html('report.html', escape=False)输出,支持嵌入简单 CSS - 若必须交付 Excel,用
openpyxl手动追加数据(非to_excel),控制每页 10 万行以内,避免单文件过大
对比逻辑上线后,哪些坑会导致「看起来没差异,其实漏了」?
最常被忽略的是数据预处理不一致:两个文件看似一样,但一个含首尾空格、一个已 strip;一个用 None 表缺失,另一个用空字符串或 'N/A';时间列一个是 datetime64,另一个是字符串。
上线前必须校验:
- 用
df.dtypes对比两表各列类型,强制统一(如都转str或都转pd.to_datetime()) - 对文本列统一执行
.str.strip().str.replace(r'\s+', ' ', regex=True) - 缺失值标准化:用
df.fillna({'col': '<null>'})</null>统一占位符,避免NaN != NaN导致漏判 - 检查 Excel 中隐藏的“空行”——
read_excel(..., skiprows=...)可能跳过标题,但数据里混着空行,得用df.dropna(how='all')清洗
真正的难点不在代码怎么写,而在确认“什么才算差异”——业务口径比技术实现更难对齐。

















