fillna应先判缺失类型再选策略:数值列用均值/中位数,时间列用pd.NaT或ffill,分类列填"Missing"并转category;须按列差异填充、禁用整表统一填、避免inplace、限制ffill/bfill长度、分组填充、填充后必验证dtype与非空数。

fillna 填什么值?先看缺失类型再选策略
直接用 fillna(0) 或 fillna("unknown") 很危险——数值型列填字符串会强制转为 object 类型,后续计算全报错;分类列填 0 可能被误当有效类别。必须先确认 dtype 和业务含义。
- 数值列(
float64):优先考虑fillna(df["col"].mean())、fillna(df["col"].median()),异常值多时用中位数更稳 - 时间列(
datetime64):不能填数字或字符串,得用pd.NaT或合理默认时间,比如fillna(pd.Timestamp("1970-01-01")) - 分类列(
object或category):填"Missing"比None更可控,且要提前用df["col"] = df["col"].astype("category")确保新值能被识别为合法类别
按列差异调用 fillna:避免整表一刀切
用 df.fillna({"A": 0, "B": "N/A", "C": df["C"].mode()[0]}) 是最常用也最安全的方式。整表统一填一个值(如 df.fillna(0))会污染非数值列,且无法处理众数为空(所有值唯一)的情况。
-
mode()返回Series,必须取[0];若列全空,mode()返回空Series,直接取[0]报IndexError,得加判断:df["col"].mode().iloc[0] if not df["col"].mode().empty else "Unknown" - 对时间列单独处理:先用
pd.to_datetime(df["time"], errors="coerce")转成datetime64,再填pd.NaT或前向填充fillna(method="ffill") - 别在原地改:始终写
df_clean = df.fillna(...),而不是df.fillna(..., inplace=True),后者在链式操作中容易出不可复现的 bug
用 method 参数做时序/结构化填充:ffill 和 bfill 的边界问题
method="ffill" 不是万能的——它只沿指定轴向前传播最后一个有效值,遇到开头连续缺失就完全无效。实际中常需组合使用或加限制。
- 限制填充长度:
fillna(method="ffill", limit=3)防止一个有效值撑起后面几十行 - 按组填充更合理:比如用户行为日志,应先
groupby("user_id")再apply(lambda x: x.fillna(method="ffill")),否则用户 A 的数据会污染用户 B 的字段 -
bfill在末尾缺失多时有用,但和ffill一样不校验逻辑合理性——比如“注册时间”列用bfill填了未来日期,程序不会报错,但业务上绝对错误
fillna 后必须验证:dtype 和非空计数是否符合预期
填完不检查等于没填。尤其要注意 object 列混入 float 或 int 后,isna() 仍返回 True,但 sum() 会直接报错。
立即学习“Python免费学习笔记(深入)”;
- 快速核对:
df_clean.dtypes看有没有意外变成object;df_clean.isna().sum()确认目标列确实为 0 - 数值列验证:填均值后用
df_clean["num_col"].describe()看min/max是否仍在合理区间,避免因原始数据有极端异常值导致均值失真 - 写进清洗函数里:每次
fillna后加一句assert df_clean[col].notna().all(), f"{col} still has NaN after fill",CI 流程里就能立刻暴露问题
最易被忽略的是:fillna 不改变原始缺失模式带来的分布偏移。比如用中位数填大量缺失的收入字段,后续建模时模型会误以为中位数是高频真实值。真正严谨的清洗,往往需要配合插值、建模预测填充,或者明确标记“已填充”列供下游感知。


















