pd.cut()用于等宽分箱(如每10岁一档),按数值边界切分;pd.qcut()用于等频分箱(如四分位),按数据分布切分,遇重复值需加duplicates='drop'。

什么时候该用 pd.cut(),什么时候选 pd.qcut()
核心区别就一条:前者按数值边界分箱,后者按数据分布分箱。如果你要等宽区间(比如每10岁一档),用 cut();如果要每档样本数差不多(比如四分位、十分位),必须用 qcut()。
常见错误是看到“分箱”就默认用 cut(),结果在偏态数据里分出大量空桶或极不均衡的桶——比如收入数据里,90%的人集中在0–20万,cut(x, bins=5) 会生成4个几乎没人、1个挤爆的区间。
-
cut()的bins参数可以是整数(等宽切分)、列表(自定义断点)或数组(如np.arange()) -
qcut()的q参数只能是整数(如 4 表示四分位)或概率序列(如[0, 0.25, 0.5, 0.75, 1]),不能传具体数值边界 -
qcut()遇到重复值多、分位点无法唯一确定时,会抛ValueError: Bin edges must be unique,这时得加duplicates='drop'或先去重/加微小扰动
cut() 自定义断点时,开闭区间怎么控制
默认左开右闭((a, b]),也就是最小值不会被包含进第一档,除非你显式设 include_lowest=True。这在处理年龄、分数这类常以整数为边界的数据时特别容易踩坑——比如想把 0–100 分划成 60 及格、70 良好、85 优秀,写 cut(scores, [0, 60, 70, 85, 100]),60 分会被分进第二档(60,70],而不是第一档(0,60]。
- 加
include_lowest=True让第一区间变成闭左:即[0, 60],60 分就归及格档了 - 所有区间仍是左开右闭,只有最左端点被特殊处理;右端点永远闭合,所以 100 分总能被包含
- 如果需要全闭区间(如 [0,60], (60,70], ...),得手动后处理标签,
cut()本身不支持
qcut() 报 “Bin edges must be unique” 怎么快速修
本质是分位点计算出来重复了,尤其当数据里有大量相同值(比如考试成绩一堆 0 分、用户留存率大量 0%),qcut() 算第25百分位和第50百分位可能都是 0,就炸了。
- 最轻量解法:加参数
duplicates='drop',自动跳过重复分位点,但注意最终箱数可能少于你指定的q - 更稳的解法:对原数据加极小随机扰动,比如
x + np.random.normal(0, 1e-8, len(x)),再qcut(),基本不影响业务含义 - 别用
np.quantile()手动算分位点再喂给cut()——那等于放弃qcut()对重复值的内置容错逻辑
分箱后怎么保留原始顺序、避免索引错乱
两个函数都默认返回 Series,且索引与输入一致。但如果你链式调用或中间用了 groupby、sort_values,就可能丢顺序。最常被忽略的是:用 qcut() 时若传入 retbins=True,它返回的是元组 (binned_series, bin_edges),直接赋值不拆包就会让变量变成元组,后续调用 .value_counts() 就报错。
- 安全写法:
cat, bins = pd.qcut(x, q=4, retbins=True),明确解包 - 如果要做后续映射(比如把区间转成数字编码),别用
cat.cat.codes直接取,它依赖 category 顺序;更可控的是用pd.Categorical(...).codes显式构造 - 分箱结果是
Categorical类型,不是字符串;想转字符串标签得调cat.astype(str),否则.str.contains()会失败
分箱看着简单,真正卡住人的永远是边界归属、重复值、类型隐式转换这三块——尤其是 qcut() 在真实业务数据里,几乎必遇到 duplicates 报错,提前加 duplicates='drop' 是条经验性保命操作。

















