
本文详解如何在 Polars 中高效计算单列(如 outcome)的指定分位数,并将结果组织为标准长格式 DataFrame;同时支持全局统计与按分组(如 a 列)分别计算,兼顾灵活性与性能。
本文详解如何在 polars 中高效计算单列(如 `outcome`)的指定分位数,并将结果组织为标准长格式 dataframe;同时支持全局统计与按分组(如 `a` 列)分别计算,兼顾灵活性与性能。
在数据探索与统计分析中,快速获取数值列的分位数(如 5%、50%、95%)是常见需求。Polars 提供了高性能的 .quantile() 方法,但其默认返回标量或 Series,若需以结构化 DataFrame 形式输出(含 quantile 和 value 两列),需结合聚合与重塑操作。
✅ 全局分位数(不按组)
若仅需对整列 outcome 计算分位数(忽略其他列),可直接使用 .select() 配合列表推导式生成多列,再通过 .unpivot() 转为长格式:
import polars as pl
QUANTILES = [0.05, 0.5, 0.95]
result_global = (
df.select(
*[pl.col("outcome").quantile(q).alias(str(q)) for q in QUANTILES]
)
.unpivot(variable_name="quantile", value_name="value")
.with_columns(pl.col("quantile").cast(pl.Float64))
)
print(result_global)输出示例:
shape: (3, 2) ┌──────────┬──────────┐ │ quantile ┆ value │ │ --- ┆ --- │ │ f64 ┆ f64 │ ╞══════════╪══════════╡ │ 0.05 ┆ 0.0717 │ │ 0.5 ┆ 0.645368 │ │ 0.95 ┆ 0.877523 │ └──────────┴──────────┘
✅ 分组分位数(按 a 列)
当需按某列(如 a)分组计算各组的分位数时,使用 .group_by().agg() 是最自然的方式。关键在于:
- 使用生成器表达式动态创建多个 .quantile(q) 聚合项;
- 每个分位数列以字符串 str(q) 命名,便于后续 unpivot;
- unpivot(index="a") 将分组键保留为索引列,其余列为 quantile/value;
- 最后用 .cast(pl.Float64) 确保 quantile 列为数值类型,便于排序或绘图。
result_grouped = (
df.group_by("a")
.agg(
*[pl.col("outcome").quantile(q).alias(str(q)) for q in QUANTILES]
)
.unpivot(index="a", variable_name="quantile", value_name="value")
.with_columns(pl.col("quantile").cast(pl.Float64))
.sort(["a", "quantile"]) # 推荐排序提升可读性
)⚠️ 注意事项与最佳实践
- 性能提示:.quantile() 在 Polars 中已高度优化,无需手动排序或插值;但避免在循环中反复调用 .quantile()——应统一在 .agg() 内批量计算。
- 精度控制:quantile() 默认使用线性插值(interpolation="linear"),如需其他方式(如 "nearest" 或 "midpoint"),显式传参:pl.col("outcome").quantile(q, interpolation="nearest")。
- 缺失值处理:若 outcome 含 null,.quantile() 默认跳过(类似 skip_nulls=True);若需严格报错,可先检查:df.filter(pl.col("outcome").is_null()).height == 0。
- 扩展性建议:将 QUANTILES 定义为常量或参数,便于复用;对大量分位点(如 np.linspace(0, 1, 101)),注意内存占用,可分批处理。
通过上述方法,你既能获得清晰、可直接用于可视化(如 seaborn 的 sns.lineplot(x="quantile", y="value", hue="a"))或下游建模的 DataFrame 结构,又能充分利用 Polars 的惰性计算与列式优化优势。

















