json.loads()只反序列化不扁平化,嵌套提取需递归遍历:对dict遍历items、list遍历元素、其他类型终止;常见错误是未先解析JSON字符串、键名不匹配或空data字段导致结果为空。

遇到嵌套 JSON 时 json.loads() 为什么只解析了一层?
因为 json.loads() 本身只做反序列化,不处理结构扁平化或字段提取。它返回的是原生 Python 对象(dict 或 list),后续所有“找某个 key 的所有值”“提取所有 id 字段”这类需求,得靠你自己遍历——而嵌套层级不确定时,循环写法很快会失控。
常见错误现象:KeyError、取到 None、漏掉某一层的 data 下的 items 再下一层的 user……本质是没覆盖递归路径。
- 别用多层
for套if 'xxx' in obj判断——层级一变就失效 - 别假设结构固定:API 返回可能在
response.data.list,也可能在response.payload.results - 递归函数必须有明确的终止条件:遇到
dict就继续查,遇到list就逐项进,遇到字符串/数字/None 就停
怎么写一个真正能穿透任意深度的递归提取函数?
核心是区分容器类型并统一 dispatch:对 dict 遍历 .items(),对 list 遍历 iter(),其他类型直接返回或跳过。下面是一个最小可用版本:
def find_keys(obj, target_key):
results = []
if isinstance(obj, dict):
for k, v in obj.items():
if k == target_key:
results.append(v)
results.extend(find_keys(v, target_key))
elif isinstance(obj, list):
for item in obj:
results.extend(find_keys(item, target_key))
return results
使用场景举例:从微博 API 返回的嵌套 JSON 中提取全部 screen_name 字段,不管它藏在 data.cards[0].mblog.user.screen_name 还是 data.card_group[2].item.content.user.name。
立即学习“Python免费学习笔记(深入)”;
- 参数差异:
target_key是你要找的键名,obj是已用json.loads()解析后的对象 - 性能注意:深层嵌套 + 大数组时,递归调用栈和列表拼接(
extend)会有开销;如需高性能,改用生成器版本(yield) - 兼容性:Python 3.7+ 均可,无需第三方库
为什么有时递归结果为空?三个最常踩的坑
不是函数写错了,而是输入或预期没对齐。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- 传入的是字符串而非 dict/list:忘了先调
json.loads(response.text),直接把原始响应文本丢进去——递归会在第一个字符(str[0])上卡住 - 目标 key 名大小写/下划线不一致:API 返回
screenName,你搜screen_name;或者实际是SCREEN_NAME - 值被包装在一层“壳”里,比如始终有
{"code": 0, "data": {...}},但你没确认data字段是否为None或空 dict,导致递归进了一个空容器,没报错也没结果
调试建议:在递归函数开头加一句 print(type(obj), len(obj) if hasattr(obj, '__len__') else '-') ,快速确认当前层级类型和规模。
需要同时提取多个 key 或带条件过滤怎么办?
硬编码多个 find_keys 调用太啰嗦,也难复用。推荐升级为支持回调的通用版:
def walk_json(obj, callback):
if isinstance(obj, dict):
for k, v in obj.items():
callback(k, v)
walk_json(v, callback)
elif isinstance(obj, list):
for item in obj:
walk_json(item, callback)
然后按需定义回调,比如提取所有非空 url:
urls = []
walk_json(data, lambda k, v: urls.append(v) if k == 'url' and isinstance(v, str) and v.startswith('http') else None)
这种写法把“遍历逻辑”和“业务逻辑”拆开,后续加日志、统计类型分布、跳过某些 key 前缀(如 __ 开头的调试字段),都只需改回调,不动主干。
真正麻烦的从来不是递归本身,而是 JSON 结构不规范、文档缺失、字段动态生成——这时候再多层递归也救不了,得先用 print(json.dumps(obj, indent=2)[:500]) 看前半截结构,再动手写逻辑。

















