本文介绍如何使用 Python 和 pandas 解析结构化 JSON 文件,将固定字段的元数据与可变长度的嵌套测量数据(如 datax/datay)高效分离,并生成规整的 DataFrame,支持按测量点分组提取或展平为列。
本文介绍如何使用 python 和 pandas 解析结构化 json 文件,将固定字段的元数据与可变长度的嵌套测量数据(如 `datax`/`datay`)高效分离,并生成规整的 dataframe,支持按测量点分组提取或展平为列。
在处理科学仪器或传感器导出的 JSON 数据时,常见一种嵌套结构:顶层包含版本信息,"data" 数组中每个元素代表一个采样点,其下既有扁平化的元数据字段(如 "metadata1"),又有嵌套的 "measurements" 数组——该数组内每个对象记录一次完整测量的 datax 和 datay 值。直接用 pd.DataFrame(data['data']) 会将整个 measurements 列作为单个列表对象保留,无法直接用于分析或绘图。
✅ 推荐方案一:展平为宽表(适合固定长度且需逐点对比)
若各测量点的 measurements 长度一致(如均为 5 组 (x,y)),可将每组测量展开为独立列,便于横向对比:
import json
import pandas as pd
with open('Filename.json') as f:
data = json.load(f)
# 遍历每个采样点,展开 measurements 中的每个 (x, y) 对
for d in data["data"]:
# 使用 pop 安全移除 measurements 并遍历
for i, m in enumerate(d.pop("measurements"), start=1):
d[f"point_{i}_x"] = m["datax"]
d[f"point_{i}_y"] = m["datay"]
df = pd.DataFrame(data["data"])
print(df)输出示例(自动对齐所有点):
metadata1 metadata2 ... point_1_x point_1_y point_2_x point_2_y ... 0 1.1 2.1 ... 0 10 0.3 15 ... 1 1.2 2.2 ... 1 20 2.3 35 ...
✅ 优势:列名清晰、兼容 Excel 导出、支持 df.plot(x='point_1_x', y='point_1_y') 直接绘图。
⚠️ 注意:要求所有 measurements 数组长度相同;若长度不一,缺失位置将填充 NaN。
✅ 推荐方案二:保留为列表列(适合长度不一或后续批量处理)
若各采样点的测量次数不同(如第 1 点有 5 组,第 2 点有 3 组),更灵活的方式是将每组 datax 和 datay 分别聚合为 Python 列表:
立即学习“Python免费学习笔记(深入)”;
for i, d in enumerate(data["data"], start=1):
datax_list = []
datay_list = []
for m in d.pop("measurements"):
datax_list.append(m["datax"])
datay_list.append(m["datay"])
d[f"datax_{i}"] = datax_list
d[f"datay_{i}"] = datay_list
df = pd.DataFrame(data["data"])
print(df)输出示例(列表列可直接用于 map() 或 apply()):
metadata1 ... datax_1 datay_1 datax_2 datay_2 0 1.1 ... [0, 0.3, 0.7, 1.1, 1.7] [10, 15, 25, 40, 55] NaN NaN 1 1.2 ... NaN NaN [1, 2.3, 3.7, 4.1, 5.7] [20, 35, 25, 30, 32]
✅ 优势:完全保留原始结构,避免截断或填充;后续可用 df['datax_1'].apply(lambda x: x[0]) 提取首值。
⚠️ 注意:列表列无法直接参与数值计算,需先 explode() 或 apply(pd.Series) 展开。
? 关键技巧说明
- 避免 KeyError:错误代码 df1=pd.DataFrame(data['measurements']) 失败是因为 'measurements' 不在顶层,而在 data['data'][i] 内部——必须先定位到具体采样点。
- pop() 的妙用:d.pop("measurements") 既安全获取嵌套数据,又从原字典中移除该键,防止后续 pd.DataFrame() 将其作为 object 列保留。
- 动态列名:使用 f"point_{i}_x" 或 f"datax_{i}" 实现自动化命名,适配任意数量的测量点。
无论选择哪种策略,核心逻辑都是:先解析 JSON → 按需遍历嵌套结构 → 显式重构为 pandas 友好格式。这比依赖 json_normalize() 更可控,尤其面对非标准嵌套时。


















