
numpy.genfromtxt() 会一次性读取并解析整个文件,导致极高内存占用;本文详解其内部机制,并提供 loadtxt、分块读取及生成器等低内存替代方案。
`numpy.genfromtxt()` 会一次性读取并解析整个文件,导致极高内存占用;本文详解其内部机制,并提供 `loadtxt`、分块读取及生成器等低内存替代方案。
numpy.genfromtxt() 的设计目标是处理结构复杂、含缺失值、混合类型或需灵活跳过/填充的 ASCII 数据,但这一灵活性是以内存开销为代价的。它确实会将整个文件逐行读入内存,并在内部构建一个 Python 列表(list)来暂存每行解析后的元组(tuple),之后才转换为 NumPy 数组。 这意味着:即使最终数组仅占几百 MB,中间的 list of tuples 可能消耗数 GB 内存——尤其对于 6300 万行以上的超大文件。
例如,以下代码:
import numpy as np
data = np.genfromtxt("large.file.txt") # 全量读取 + 元组列表缓存 → 高内存峰值会触发完整文件 I/O,并在内存中同时存在原始字符串行、解析后的 tuple 对象集合,以及最终的 ndarray。这是不可绕过的流程,因为 genfromtxt 需要多遍扫描(如推断 dtype、定位缺失值、处理注释等),无法流式构造固定形状数组。
更省内存的替代方案
✅ 首选:numpy.loadtxt()(适用于规整数值数据)
若文件是纯数值、无缺失值、列对齐良好(如空格/制表符分隔),loadtxt 是更优选择。其底层 C 实现(rows.c)直接将解析结果写入预分配的 NumPy 数组,跳过了高开销的 Python 对象中间层:
# 内存效率更高,但不支持自动缺失值处理或混合类型
data = np.loadtxt("large.file.txt", delimiter="\t", skiprows=0)✅ 进阶:分块读取(Chunked Reading)
当文件过大无法全载入时,可结合 pandas.read_csv(..., chunksize=N) 或手动分块:
import numpy as np
def read_large_file_chunked(filename, chunk_size=100000):
data_chunks = []
with open(filename, "r") as f:
while True:
lines = [f.readline() for _ in range(chunk_size)]
lines = [l for l in lines if l] # 过滤空行
if not lines:
break
chunk = np.loadtxt(lines, delimiter=" ", dtype=float) # 注意:需确保每块格式一致
data_chunks.append(chunk)
return np.vstack(data_chunks)
# 使用示例(注意:实际应用中建议用 pandas 处理更鲁棒)
# data = read_large_file_chunked("large.file.txt")✅ 终极轻量:生成器 + 手动解析(最低内存)
若只需逐行计算(如统计、过滤、流式处理),完全避免加载全部数据:
def line_generator(filename):
with open(filename, "r") as f:
for line in f:
yield np.fromstring(line.strip(), sep=" ") # 按需解析单行
# 示例:计算每行均值,不保存全部数据
for row in line_generator("large.file.txt"):
print(np.mean(row))⚠️ 重要提醒:
- 无论使用哪种方法,最终
ndarray本身所需的内存由数据规模决定,无法减少;优化重点在于降低 中间过程 的内存峰值。 -
genfromtxt的强大功能(如missing_values,filling_values,usecols,dtype=None)在loadtxt中受限,务必根据数据特征权衡。 - 对于 TB 级文件,建议结合 Dask 或 Apache Arrow 等分布式/列式工具,而非纯 NumPy 方案。
综上,面对超大 ASCII 文件,应优先放弃 genfromtxt,转向 loadtxt(规整数据)、分块加载(需全量分析)或生成器流式处理(仅需迭代),从而在保持功能前提下显著降低内存压力。

















