numpy.select最稳妥,适用于多条件多值映射;pd.cut更高效,适合数值区间分段;map+字典最快,仅限离散键值映射;避免用apply做简单条件映射,性能差。

用 numpy.select 实现多条件多值映射最稳妥
当判断逻辑超过两个分支、且每个分支对应不同输出值时,numpy.select 是比嵌套 np.where 更清晰、更易维护的选择。它明确分离条件列表和选择列表,避免括号嵌套混乱。
常见错误是把条件写成字符串(如 "df['age'] > 18")或漏掉 default 参数——这会导致 ValueError: shape mismatch。
- 条件必须是布尔数组,例如
df['score'] >= 90,不能加引号 -
choicelist长度必须与condlist一致 -
default不可省略;建议显式写成default=np.nan或具体兜底值
import numpy as np
import pandas as pd
df = pd.DataFrame({'score': [95, 82, 76, 45, 88]})
conditions = [
df['score'] >= 90,
df['score'] >= 80,
df['score'] >= 60
]
choices = ['A', 'B', 'C']
df['grade'] = np.select(conditions, choices, default='F')
用 pd.cut 处理数值区间映射更高效
如果映射规则本质是“分段打标”(比如 0–59→F,60–69→D),pd.cut 比手写条件更简洁、底层也更快。它自动处理边界、支持右闭左开等选项,还内置标签生成能力。
容易踩的坑是没注意 right=True 默认行为导致边界归属错位,或传入的 bins 和 labels 长度不匹配(len(labels) 必须等于 len(bins)-1)。
立即学习“Python免费学习笔记(深入)”;
- 用
include_lowest=True让最小值能被包含(否则bins=[0,60,70]中 0 可能无标签) -
labels为None时返回区间对象,适合后续计算;设为列表才得自定义字符串 - 若数据含
NaN,pd.cut默认保留为NaN,无需额外处理
df['level'] = pd.cut(
df['score'],
bins=[0, 60, 70, 80, 90, 100],
labels=['F', 'D', 'C', 'B', 'A'],
include_lowest=True
)
用 map + 字典适用于离散键值映射
当原始列是有限离散值(如状态码、类别编码),且映射关系固定、无逻辑判断,Series.map 是最快最直观的方式。它底层走哈希查找,比任何条件判断都快。
典型误用是拿它去处理带范围或表达式的条件——比如想用 map 实现 “score>85 → 'high'”,这会直接返回全 NaN,因为字典里没有布尔值 True 这个 key。
- 字典缺失 key 默认转为
NaN;加na_action='ignore'可保留原NaN - 若需默认值,用
map(dict_.get, 'default')形式,避免fillna多一步 - 字典 key 类型必须与列 dtype 严格一致(如列是
int64,key 写1而非'1')
status_map = {1: 'active', 0: 'inactive', 2: 'pending'}
df['status_text'] = df['status_code'].map(status_map)
别在 apply 里写 if-elif-else 做映射
虽然语法上可行,但 df['col'].apply(lambda x: 'A' if x>90 else 'B' if x>80 else 'C') 在数据量稍大时性能极差——它强制逐行 Python 解释执行,完全失去 Pandas 向量化优势。
除非逻辑极度复杂(比如要调用外部 API 或正则捕获多组变量),否则所有简单条件映射都应避开 apply。实测万行数据下,np.select 比同等逻辑的 apply 快 50 倍以上。
- 如果必须用
apply,确保函数已用@numba.jit编译或改写为向量化操作 - 调试时
apply输出易读,但上线前务必替换为向量化方案 - 用
df.loc配合布尔索引虽稍啰嗦,但可读性和性能平衡得更好


















