
本文详解如何将 CSV 文件中以逗号分隔的多值字段(如 "1, 5"、"Monday, Tuesday")解析为独立的嵌套对象,并最终生成符合结构要求的 JSON 数组,避免字符串拼接导致的嵌套错误。
本文详解如何将 csv 文件中以逗号分隔的多值字段(如 `"1, 5"`、`"monday, tuesday"`)解析为独立的嵌套对象,并最终生成符合结构要求的 json 数组,避免字符串拼接导致的嵌套错误。
在处理配置类或调度规则类 CSV 数据时,常遇到某些列(如 frequency_count、day_of_week)包含多个用逗号分隔的值,例如 "1, 5" 或 "Monday, Tuesday"。若直接调用 to_dict('records'),Pandas 会将整列视为单个字符串,导致后续 JSON 输出中嵌套结构失效——本应拆分为两个独立 pattern 对象,却合并成了一个含逗号字符串的扁平对象。
要实现真正的“一行变多行”嵌套,核心在于三步:解析 → 展开 → 聚合。
✅ 步骤一:将多值字符串转为 Python 列表
使用 .str.split(r",\s*")(正则支持可选空格)安全分割,确保 "1, 5" → ["1", "5"],"Thursday,Friday" → ["Thursday", "Friday"]:
import pandas as pd
df = pd.read_csv(csv1, delimiter=';', keep_default_na=False, dtype=str)
multi_cols = ["frequency_count", "schedule_type", "day_of_week", "Comments"]
for col in multi_cols:
df[col] = df[col].str.split(r",\s*")⚠️ 注意:dtype=str 比 dtype=object 更稳妥,避免 NaN 被误转为浮点;keep_default_na=False 防止 "null" 被自动识别为 NaN。
✅ 步骤二:对多值列执行 explode()
explode() 将每个列表元素展开为独立行,同时广播其他列值。关键点是传入列名列表(Pandas ≥ 1.3.0 支持多列同步 explode):
df = df.explode(multi_cols, ignore_index=True)
此时原第1行(Pattern 2)将扩展为2行,每行对应一个 frequency_count + 对应的 day_of_week 组合,且 schedule_type 与 Comments 同步对齐。
✅ 步骤三:构建嵌套 patterns 并导出 JSON
先构造 patterns 字段为字典列表,再用 pivot_table(..., aggfunc=list) 将同名 pattern 的所有子项聚合成数组(而非默认的 first):
# 构建 patterns 字段(注意:保留原始字符串类型,如需数字可后处理 int(x))
df["patterns"] = df[["frequency_count", "schedule_type", "day_of_week"]].to_dict("records")
# 规范 Comments:将 NaN 或字符串 "null" 统一为 None(JSON 中输出 null)
df["Comments"] = df["Comments"].replace("null", None).where(pd.notna(df["Comments"]), None)
# 按顶层字段分组,聚合 patterns 为列表
result_df = df.pivot_table(
index=["name", "frequency", "frequency_start_date", "Comments"],
values="patterns",
aggfunc=list
).reset_index()
# 输出标准 JSON(indent=4 提升可读性)
json_output = result_df.to_json(orient="records", indent=4, default_handler=str)
print(json_output)✅ 最终输出效果(符合预期)
- 每个 pattern 是独立字典;
- patterns 字段是字典列表(非单个字典);
- Comments 正确映射为 null;
- 多值字段一一对应(如 "1" ↔ "Monday","5" ↔ "Tuesday")。
? 扩展提示:若需 frequency_count 转为整数,可在 to_dict 前添加 df["frequency_count"] = df["frequency_count"].astype(int);若存在不等长多值列(如 day_of_week 有2个值但 schedule_type 只有1个),建议先校验长度一致性,或使用 zip_longest 填充,避免 explode 异常。
此方案彻底解决“CSV 多值列 → DataFrame → 嵌套 JSON”链路中的结构失真问题,适用于调度配置、权限规则、产品变体等典型多对一数据建模场景。


















