
本文介绍如何在 polars 中优雅、高效地对多个数值列(如 value1/value2/value3)按时间窗口(如 "30d"、"90d")和分组键(如 strike、maturity)批量计算 z-score,避免冗余聚合与重复代码。
本文介绍如何在 polars 中优雅、高效地对多个数值列(如 value1/value2/value3)按时间窗口(如 "30d"、"90d")和分组键(如 strike、maturity)批量计算 z-score,避免冗余聚合与重复代码。
在 Polars 中实现类似 Pandas groupby(...).transform(...) 的滚动 Z-Score 计算,关键在于*组合使用窗口函数(.over())与正则列选择(`pl.col("^value.$")`)**,而非先聚合再连接——后者不仅代码冗长,还会引入中间列、降低可读性与执行效率。
✅ 推荐方案:基于 .over() 的向量化 Z-Score
以下是最简洁、高性能的实现方式(以 "30d" 窗口为例):
import polars as pl
result = (
df.lazy()
.sort("date", "strike", "maturity")
.set_sorted("date") # 显式声明 date 已排序,加速 rolling 操作
.with_columns(
(
(pl.col(r"^value.*$") -
pl.col(r"^value.*$").rolling_mean(window_size="30d", by="date", min_periods=1))
/ pl.col(r"^value.*$").rolling_std(window_size="30d", by="date", min_periods=1)
)
.over(["strike", "maturity"]) # 按分组键广播结果
.name.suffix("_30d_zscore") # 自动为每列添加后缀
)
.select("date", "maturity", "strike", pl.col(r"^.*_30d_zscore$"))
.collect()
)该写法优势显著:
- 零中间列:无需显式计算 mean/std 并存为临时列;
- 批量处理:正则 ^value.*$ 一次性覆盖所有目标列(如 value1, value2, value3),逻辑复用;
- 语义清晰:.over(["strike", "maturity"]) 明确表达“在每个分组内独立计算滚动统计”;
- 性能优化:.set_sorted("date") 告知 Polars date 列已升序,跳过内部排序,大幅提升 rolling_* 效率。
? 扩展至多窗口:封装为可复用函数
当需同时计算 "30d"、"90d" 等多个窗口时,推荐将 Z-Score 逻辑封装为参数化函数:
def rolling_zscore(
expr: pl.Expr,
window_size: str,
by: str = "date",
min_periods: int = 1,
**kwargs
) -> pl.Expr:
"""对表达式计算滚动 Z-Score,支持多列批量处理"""
mean_expr = expr.rolling_mean(window_size=window_size, by=by, min_periods=min_periods, **kwargs)
std_expr = expr.rolling_std(window_size=window_size, by=by, min_periods=min_periods, **kwargs)
return (expr - mean_expr) / std_expr
# 应用于多个窗口
windows = ["30d", "90d", "180d"]
result = (
df.lazy()
.sort("date", "strike", "maturity")
.set_sorted("date")
.with_columns(
rolling_zscore(pl.col(r"^value.*$"), window_size=w, min_periods=1)
.over(["strike", "maturity"])
.name.suffix(f"_{w}_zscore")
for w in windows
)
.select(
"date", "maturity", "strike",
pl.col(r"^.*_zscore$")
)
.collect()
)此设计带来三大收益:
- 高可维护性:Z-Score 逻辑集中定义,修改一处即全局生效;
- 并行执行:Polars 会自动并行处理各窗口的 .with_columns(...) 表达式;
- 灵活扩展:只需增删 windows 列表即可新增/移除窗口,无需重写核心逻辑。
⚠️ 注意事项与最佳实践
- min_periods=1 是必需的:避免因窗口初期数据不足导致 null,确保首行也有有效值(若业务要求严格窗口长度,可设为 min_periods=len(window_size) 对应的最小天数);
- by="date" 必须指定:rolling_mean/std 在 by 列上执行时间窗口,否则默认按行索引滚动,不符合业务意图;
- 避免 rolling(...).agg(...) + join:原始写法中先聚合再连接,不仅代码膨胀,还易因排序/索引错位引入隐性错误;
- .lazy() 强烈建议:尤其在大数据量下,延迟执行可触发 Polars 查询优化器合并操作,显著提升吞吐量。
通过以上方法,你不仅能写出更短、更健壮的 Polars 代码,还能充分利用其底层优化能力,在保持语义精确的同时达成高性能计算。

















