
本文介绍使用pandas快速为数值型或任意类型列中的缺失值(NaN)生成二元指示变量的方法,核心是利用Series.isna()配合类型转换,简洁高效且避免常见比较陷阱。
本文介绍使用pandas快速为数值型或任意类型列中的缺失值(nan)生成二元指示变量的方法,核心是利用`series.isna()`配合类型转换,简洁高效且避免常见比较陷阱。
在数据预处理中,常需将缺失值显式编码为二元变量(即“缺失=1,非缺失=0”),以便后续建模或分析。但直接用 == np.nan 或 == 'Nan' 判断是无效的——因为根据IEEE标准,np.nan != np.nan 恒为 True,任何与 NaN 的等值比较均返回 False,因此 np.where(df['a'] == np.nan, 1, 0) 只会输出全0。
正确做法是使用 pandas 内置的向量化方法 Series.isna()(推荐)或 Series.isnull()(二者功能完全等价):
import pandas as pd
import numpy as np
# 构造示例数据
df = pd.DataFrame({'a': [3, 2, np.nan, 3, np.nan]}, index=[1, 2, 3, 4, 5])
# ✅ 正确:生成缺失值指示变量
df_miss_a = df["a"].isna().astype(int)
print(df_miss_a)输出:
1 0 2 0 3 1 4 0 5 1 Name: a, dtype: int64
该方案优势显著:
调用 Cutout.Pro 视觉处理 API 进行背景移除、人像抠图和照片增强,支持文件上传与图片 URL 输入。
立即学习“Python免费学习笔记(深入)”;
- 健壮性高:isna() 自动识别所有类型的缺失标识(np.nan, None, pd.NaT 等);
- 性能优异:底层C优化,远快于循环或 apply(lambda x: pd.isna(x));
-
链式友好:可无缝嵌入 .assign() 或管道操作中,例如:
df = df.assign(df_miss_a=df['a'].isna().astype(int))
⚠️ 注意事项:
- 避免使用 df['a'].isnull().map({True: 1, False: 0}) —— 虽然可行,但 astype(int) 更简洁高效;
- 若需反向编码(缺失=0,非缺失=1),可改用 (~df['a'].isna()).astype(int);
- 对于多列批量处理,可用 df.isna().astype(int) 直接生成完整缺失指示矩阵。
掌握 isna() + astype(int) 这一组合,是Pandas数据清洗中处理缺失值最实用、最地道的技巧之一。

















