最常用做法是df.to_dict(orient="records"),将每行转为字典并组成列表;误用orient="dict"或"list"会返回列名映射结构;含NaN时对应值为np.nan,可先fillna;性能优于逐行转换;按某列作key需先set_index再to_dict(orient="index"),注意重复索引会覆盖。

用 to_dict(orient="records") 直接转多列 DataFrame 为字典列表
这是最常用也最符合直觉的做法:把每一行变成一个字典,所有行组成列表。只要 DataFrame 里没有嵌套结构或不可哈希类型(比如 list、dict 本身),就能直接用。
常见错误是误用 orient="dict" 或 orient="list",它们返回的是「列名 → 值序列」结构,不是你想要的「每行一个字典」。
-
df.to_dict(orient="records")返回[{"col1": val1, "col2": val2}, ...] - 如果某列含
NaN,对应字典中该键值会是np.nan;需清洗可配合df.fillna(...).to_dict(...) - 性能上,
orient="records"比循环df.iloc[i].to_dict()快得多,尤其数据量 > 1k 行时明显
想按某列为 key 构造字典?用 set_index().to_dict(orient="index")
比如你有一列叫 "id",想让每个 id 对应它所在行的其余字段,就得先设索引再转。
容易踩的坑是忘记重置索引或没处理重复 id:Pandas 遇到重复索引会静默覆盖,只保留最后一个。
立即学习“Python免费学习笔记(深入)”;
- 正确写法:
df.set_index("id").to_dict(orient="index")→{"id1": {"col2": x, "col3": y}, ...} - 若
"id"有重复,先用df.drop_duplicates(subset=["id"], keep="first")显式控制 -
orient="index"的 value 是Series,不是纯 dict;如需纯字典,加.apply(dict):df.set_index("id").to_dict(orient="index").apply(dict)
只转特定几列?先用 df[["col_a", "col_b"]] 切片再转
别在 to_dict() 之后再删键,效率低还易出错。Pandas 支持链式切片,干净又安全。
注意列名必须存在,否则报 KeyError;若列名可能缺失,用 df.reindex(columns=["col_a", "col_b"], fill_value=None) 更鲁棒。
- 示例:
df[["name", "score"]].to_dict(orient="records") - 如果某列是
datetime64类型,默认转成Timestamp对象;要字符串可用df["col"].dt.strftime("%Y-%m-%d")预处理 - 布尔列转字典后仍是
True/False,不会变"True"字符串 —— 这点常被 JSON 序列化时忽略,导致前端解析失败
遇到 TypeError: unhashable type: 'list' 怎么办?
这说明某列里存了 list、dict 或其他不可哈希对象,to_dict() 内部尝试构造字典时崩了。Pandas 不拒绝这种数据,但转字典时暴露问题。
根本原因不是语法错,而是数据本身不满足字典 key/value 的基本要求(value 可以是 list,但列里若混了 list 和 scalar 就可能触发内部逻辑异常)。
- 快速检查:
df.applymap(type).nunique()看每列是否类型混杂 - 临时绕过:用
df.astype(str).to_dict(orient="records")强制全转字符串(仅调试用) - 正解是清洗:对问题列用
df["col"] = df["col"].apply(lambda x: x if isinstance(x, (str, int, float)) else str(x))
to_dict(orient="records") 就够了。真正麻烦的是那些隐性类型混杂、空值语义模糊、或需要和 JSON/前端深度对接的场景——这些地方不打日志、不看 df.dtypes 和 df.iloc[0].apply(type),很容易卡半天。


















