
本文介绍如何在 Python 中高效读取上千个大型 CSV 文件的最后 100 行,避免加载整文件导致的内存与性能瓶颈,核心是利用 pandas.read_csv 的 skiprows 参数跳过前置行,或结合底层文件操作实现零内存开销的精准定位。
本文介绍如何在 python 中高效读取上千个大型 csv 文件的最后 100 行,避免加载整文件导致的内存与性能瓶颈,核心是利用 `pandas.read_csv` 的 `skiprows` 参数跳过前置行,或结合底层文件操作实现零内存开销的精准定位。
当面对 1000+ 个、每文件约 10 万行的 CSV 数据时,直接使用 pd.read_csv(file_path) 加载全部内容不仅耗时(I/O + 解析),还会引发显著内存压力(尤其在 Pandas 默认构建完整 DataFrame 的情况下)。优化关键在于:只读取必要数据,跳过无关行。
✅ 推荐方案一:已知行数时 —— 使用 skiprows(最简高效)
若所有 CSV 文件行数高度一致(如均为 100,000 行),可直接跳过前 N−100 行:
import pandas as pd # 假设每文件恰好 100,000 行,只需最后 100 行 df = pd.read_csv(file_path, skiprows=99900, nrows=100)
⚠️ 注意:skiprows=99900 表示跳过前 99,900 行(即保留第 99,901 行起的 100 行);nrows=100 确保最多读取 100 行,增强鲁棒性。
该方法无需预扫描文件,由 Pandas 底层 C 引擎高效跳过字节流中的行,速度远超逐行读取,且内存占用仅与目标行数成正比。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
✅ 推荐方案二:行数未知时 —— 反向读取(通用稳健)
对行数不固定或含空行/注释的 CSV,推荐用 tail 风格的反向扫描(无需第三方库):
def read_last_n_lines(filepath, n=100, encoding='utf-8'):
with open(filepath, 'rb') as f:
f.seek(0, 2) # 移动到文件末尾
file_size = f.tell()
if file_size == 0:
return []
lines = []
buffer = b''
pos = file_size - 1
while pos >= 0 and len(lines) < n:
char = f.read(1)
if char == b'\n' and buffer:
lines.append(buffer[::-1].decode(encoding))
buffer = b''
else:
buffer += char
pos -= 1
if buffer and len(lines) < n:
lines.append(buffer[::-1].decode(encoding))
return lines[::-1] # 恢复正序
# 转为 DataFrame(需处理 CSV 解析逻辑,建议配合 csv 模块)
import csv
from io import StringIO
last_lines = read_last_n_lines(file_path, 100)
csv_str = '\n'.join(last_lines)
df = pd.read_csv(StringIO(csv_str))? 提示:此方法本质是“从后往前逐字节扫描”,时间复杂度 O(k),k 为末尾所需字节数,与总行数无关,适用于任意大小文件。
? 关键注意事项
- 首行是否为 header? 若 CSV 含表头,skiprows 方式需额外判断:若跳过的行包含 header,则需设置 header=None 并手动指定列名;反向读取方式建议先获取一行样本推断结构。
- 编码与分隔符:确保 encoding 和 sep 参数与原始文件一致,否则解析可能失败。
- 内存 vs. 灵活性权衡:skiprows 最快但依赖行数稳定性;反向读取通用性强,适合生产环境部署。
- 批量处理优化:配合 concurrent.futures.ThreadPoolExecutor 并行处理多文件,可进一步提升吞吐量(I/O 密集型任务适用)。
综上,根据数据一致性选择策略:行数稳定优先用 skiprows;动态场景首选反向读取 + StringIO + pd.read_csv 组合。二者均能将单文件处理时间从秒级降至毫秒级,彻底规避全量加载陷阱。

















