最常用稳妥的多条件逐行判断替换方式是numpy.where,支持嵌套、可读性强、性能优;需赋值回DataFrame才生效,单层及嵌套用法明确,且Pandas自动对齐索引。

用 numpy.where 实现多条件逐行判断替换
直接改列值最常用也最稳妥的方式是 numpy.where,它支持嵌套、可读性强,且底层用 C 实现,性能比纯 Python 循环好得多。注意它返回的是新数组,要赋值回 DataFrame 才生效。
- 单层条件:
df['col'] = np.where(df['col'] > 10, 'high', 'low') - 嵌套多条件(等价于 if-elif-else):
df['col'] = np.where(df['col'] - 避免写成
df['col'].where(...)—— 这是 Pandas 的where方法,作用相反(保留满足条件的值,其余变 NaN),容易混淆 - 如果条件依赖其他列,直接写
df['A'] > df['B']即可,Pandas 自动对齐索引
用 pd.Series.map + 自定义函数处理离散映射逻辑
当替换逻辑是“把某些具体值映射为另一些值”,比如状态码转文字、ID 转名称,map 比 where 更直观。它天然忽略 NaN,适合有缺失值的场景。
- 传字典最简单:
df['status'] = df['status'].map({1: 'active', 0: 'inactive', 2: 'pending'}) - 传函数更灵活:
df['score_level'] = df['score'].map(lambda x: 'A' if x >= 90 else 'B' if x >= 80 else 'C') - 注意:字典中没覆盖的 key 会变成 NaN;若想保留原值,加
na_action='ignore'不起作用,得用fillna(df['score'])补回去 - 函数里别用 print 或耗时操作——
map是逐元素调用,大数据量时很慢
用 pd.Series.mask 或 pd.Series.loc 做原地条件修改
mask 和 loc 都支持布尔索引,适合“只改一部分值,其余不动”的场景。它们不依赖外部库,语义清晰,但要注意链式赋值警告。
-
mask是“满足条件就替换成指定值”:df['price'] = df['price'].mask(df['discount'] > 0.5, df['price'] * 0.7) -
loc更通用,可同时改多列:df.loc[df['category'] == 'electronics', 'tax_rate'] = 0.12 - 别写
df['col'][condition] = value—— 这触发 SettingWithCopyWarning,且有时不生效(尤其从 groupby 或切片得来子集时) - 布尔条件里用
&(不是and)、|(不是or)、~(不是not),括号不能省:(df['a'] > 1) & (df['b']
为什么不用 apply?什么情况下才考虑它
apply 看起来自由度高,但绝大多数条件替换场景下它是性能黑洞,且容易写出不可靠代码。
立即学习“Python免费学习笔记(深入)”;
- 99% 的情况,
where/map/mask能覆盖;apply应该是最后选项 - 如果逻辑必须依赖行内多个字段的复杂计算(比如 “根据前一行 price 和当前 volume 计算波动标记”),才考虑
apply+axis=1 -
apply返回标量时,Pandas 会尝试推断 dtype,可能把 int 列变成 float;显式指定dtype或用astype补救 - 函数里别修改传入的 Series 或 DataFrame——
apply传的是视图或副本,行为不确定
真正麻烦的从来不是“怎么写”,而是条件边界是否覆盖了所有分支、NaN 怎么处理、原始 dtype 是否被意外改变。这些细节不打印出来看一眼,很容易在下游计算里突然报错。


















